文婷 发自 凹非寺
量子位 | 公众号 QbitAI
曾经只能手动摘取PDF文字、结果乱码一堆、LLM还看不懂的苦逼日子——
终于要结束了!
Y Combinator孵化的明星项目Firecrawl团队最近放了个大招:
其联合创始人兼CTO Nicolas Camara宣布,他们最新开发的OCR It可以在20ms内将一份不可复制的PDF文件内的所有文字内容提炼完,并 将其转化成清晰的Markdown格式 ,AI读完马上就能看懂。
20ms是什么概念?
相当于你刚点完确定还没眨完眼,一份处理好的Markdown文件就已经清清爽爽地交到你手上了。
而且它还不需要联网,可以100%Offline via Bundled Tesseract。
这个刚刚开源的OCR工具才刚发布, 就在GitHub上获得了热门关注。
Nicolas Camara骄傲地表示,在处理质量与Docling旗鼓相当的前提下,OCR It的处理速度比Docling快了近300倍 !
小伙伴们测完也纷纷在X上留言:
快,确实快得很啊!
OCR It怎么用
首先,OCR It是一款适用于Chrome和Firefox的免费浏览器插件。
你只需框选一次区域,之后每按一次快捷键 (或开启自动模式),它就能把整本书或整个文档变成完整且可编辑的纯文本,方便你直接喂给AI进行总结或提问。
具体而言,手动和自动档可以分别按以下的几个步骤操作:
(注:用Windows和Linux的小伙伴们需将option键替换为Alt)
1、手动档:
2、自动档:
自动挡的话就简单多了,你只需要按下Option+Shift+A 或点击Start auto-run ,OCR It便会自动循环执行“截图—OCR—翻页”,直至文档结束。
如果你想中途结束任务的话,按ESC就行,检查流程几乎和手动档一致。
此外,OCR It仓库界面显示,它既不需要API Key、联网、安装时也不需要索取任何网站权限,它只会在需要自动运行或操作跨域iframe时才按需申请当前站点的权限。
另外,浏览器内置PDF阅读器目前也还暂时不支持自动翻页,所以大家在处理这类PDF时,还是尽量用手动档处理吧。
处理复杂任务时还不太稳定
不过,OCR It虽然看起来又快又方便,但还远没有到“以后把所有PDF都丢给它,就能高枕无忧”的程度。
网友们通过实测达成的一个共识是:
OCR It目前可以相当顺手地处理版式简单、文字清晰的PDF文档,但它还不太能处理一些标题、脚注、表格、数学公式和正文段落混排的复杂页面,所以它还有不小的提升空间。
让我们期待一下团队后续的更新吧!