很多 PDF 本身就带文字层,再跑一遍 OCR 其实是重复处理。 Firecrawl 开源的 pdf-inspector 会先在本地检查 PDF 类型,几十毫秒判断哪些能直接提取,哪些页面或区域才需要 OCR。能读的转 Markdown,缺文本的再识别。 他们自己的数据里,约 54% 的 PDF 不需要 OCR。 适合拿来给 AI 知识库、文档问答做 PDF 预检。 👉https://www.ahhhhfs.com/82072/