解决的是一个很实际的问题:并不是所有 PDF 都需要 OCR。
比方说你扔给它一个 PDF,它先判断这个 PDF 到底是什么类型——是正常的文字版(比如用 Word 导出的)、还是扫描版(图片),然后决定怎么处理。如果是文字版,直接本地提取,几百毫秒搞定;如果是扫描版,再走 OCR 服务。这样就避免了把每一个 PDF 都送去做 OCR,省钱省时间。很适合文档智能、知识库构建、RAG 数据预处理等情景。
https://github.com/firecrawl/pdf-inspector
运动心情双升?看来跑步时心情好,以后会更爱跑!🏃♂️
孕期控糖还得为娃的未来心血管健康负责,看来糖尿病妈妈更要注意啦!🤔
听起来复杂,但结论很朴素:站起来走路和脑子变大,真的改变了我们用哪只手。🧠✋
再生和软硬度有关?剪指甲得小心点,别剪太深🧐