🔥实时更新 频道/群组搜索 登录
TG资源网
ahhhhfs|A姐分享 08-18 17:47:03

很多 PDF 本身就带文字层,再跑一遍 OCR 其实是重复处理。 Firecrawl 开源的 pdf-inspector 会先在本地检查 PDF 类型,几十毫秒判断哪些能直接提取,哪些页面或区域才需要 OCR。能读的转 Markdown,缺文本的再识别。 他们自己的数据里,约 54% 的 PDF 不需要 OCR。 适合拿来给 AI 知识库、文档问答做 PDF 预检。 👉https://www.ahhhhfs.com/82072/

附件:[图片]