文章总结: Firecrawl团队开源基于Rust的文档转换库anydoc,可将PDF、Word等14种格式极速转为Markdown。该工具转换中位数仅4.4毫秒,基于字节头识别真实格式且无外部依赖。它统一了内部文档模型与API,大幅降低RAG与Agent开发的文档预处理门槛,开发者可一行命令直接调用。 综合评分: 78 文章分类: 软文广告,产品介绍
Firecrawl 又又又开源一个神级 skill ,暴涨 1 万 Star 。
原创
开源日记 开源日记
开源日记
2026年8月8日 15:12 湖北
在小说阅读器读本章
去阅读
做过的 RAG 或者 Agent开发的朋友,都会遇到同一个问题。
要把几百个PDF、Word、PPT 处理成Markdown,喂给模型。
用过 LibreOffice,很慢,我试过转一个文档要一秒钟以上。
试过用写 Python 脚本来处理,解析库遇到复杂表格就会出现乱码,合并单元格也会丢失。
更夸张的是,有时候用户传过来一个文件,看着后缀名是.docx,但是实际上是.pdf文件,识别程序直接错乱崩溃。
最近我在 GitHub 上看到了 Firecrawl 团队开源的新项目,专门来解决这个问题。
它叫 anydoc,在线五天之后,在 GitHub 上就获得了11000多个star。
它就是将各种办公文档转换为干净的Markdown格式的Rust库。
Word、PPT、Excel、PDF、RTF、EPUB、CSV,14 种格式全支持。
转一个文档,中位数只有 4.4 毫秒。比LibreOffice快了 256 倍,比第二名快了 20 多倍。
而且不需要安装任何东西,一行命令就可以完成。Firecrawl 还把它做成 Agent Skill,你的 AI 编程助手也可以直接使用。
我给你演示一把,你就会知道这个东西有牛X了
假设你手里有一堆乱七八糟的文档,要喂给 RAG 系统。
有2003年的.doc文件、同事发来的.pptx文件、客户提供的老格式.xls文件以及一些.epub电子书。
以前要一个一个地打开、另存为、再转换格式。
安装后,终端输入一行命令即可,无需脚本或环境配置。anydoc自动识别真实格式,不依赖后缀名,即使文件被重命名也能正确转换。
然后转换为干净的Markdown。
标题有锚点、表格合并单元格全部保留、嵌套列表层次分明、脚注尾注无一遗漏。
单文件转换不到500毫秒,批量100个同样在半秒内完成。以前用LibreOffice要等大约 2 分钟左右。
整个过程中,识别、解析、转换都是它自己完成的,你不需要再去管其它的了。
如果文档中包含图片的话,在Markdown中会保留替代文本,并且原始图片的数据也会一同返回,不会丢失。
有人要好奇了,它是怎么做到的
01 用一个文档模型来处理所有的格式。
每种格式先被各自的解析器拆解。Word 有自己的解析器,PPT 有自己的解析器,Excel 有自己的解析器。
但是拆完之后都映射到了同一个内部文档模型里面。
标题、段落、表格、列表、脚注、嵌入资源等都属于一个结构体。
最后使用同一个Markdown序列化器来输出。
这种设计将维护成本集中在模型和序列化层,无需为每种格式单独写输出逻辑。
02 格式检测不看后缀名,只看字节头。
它是根据文件的原始字节签名来读取的。PDF头、RTF开头标记、OLE流名、ZIP包的mimetype。
CSV 没有签名,才需要扩展名或显式指定。这在生产环境里特别实用,用户上传的文件后缀名经常是乱的,anydoc 不在乎。
03 绑定层不会阻塞主线程。
Node.js 的转换在 libuv 线程池中进行,不会影响到事件循环。Python 的转换会释放 GIL,其他的线程仍然可以正常运行。
TypeScript 类型以及 Python stub 都被直接打包进包中,开发体验非常棒。
都使用了社区的标准方案,Node 用的是 NAPI-RS,Python 用的是 PyO3。
还有WASM版本,在浏览器中运行,文件不会上传到第三方。
04 无机器学习、无GPU、无第三方服务。
是用纯Rust写的,没有用到任何机器学习模型,不需要GPU,也不需要调用外部API。
4.4毫秒是只用Ryzen 9的CPU跑出来的,还没有用上 GPU 加速,用上估计会更猛。
官方用了 100 份真实的文档进行了一轮盲评,对 14 种格式都做了测试,并且一共评了 482 次, Claude 给出的分数如下。
anydoc 是唯一一个包含所有的 14 种格式,并且每个格式的评分都是最高的。
同场对比的,是 LibreOffice、pandoc、unstructured、markitdown、docling、mammoth 这些主流工具。
效果这么好,估计大家已经迫不及待想试试了
Node.js 和 Python 用户,只需要一条命令就可以安装好:
npx @firecrawl/anydoc report.docx
pip install firecrawl-anydoc
Rust 用户直接使用 cargo add,浏览器中也可以运行,安装WASM包就可以了。
想在代码里调用,四个语言的 API 完全一致:to_markdown、to_markdown_bytes、to_document。
CLI 也不局限于一个文件,可以用 -o 指定输出文件,用 –format 指定格式,也可以从标准输入读取内容。
如果你是Claude Code或者Codex用户,只需要一行命令就可以使Agent具有读取文档的能力:
npx skills add firecrawl/anydoc
到这里边界也给大家提提
只有图片的PDF是不能转换的,因为没有OCR。
文本型的走本地解析,可以直接转换。
扫描件要使用Firecrawl的云解析接口。
加密过的文档也不行,会直接报出Encrypted错误。
格式错误或者超出安全限制的文件也会返回明确的错误码,而不会出现无头苍蝇一样乱转的情况。
写在最后
Firecrawl 做网页抓取做到了 14.9 万 Star,现在把文档解析也开源了。
他们自己要这个能力来驱动 Parse 产品,造出来之后顺便开源,既造福了社区,也给自己的商业产品打广告。
anydoc 最打动我的地方是省心。
无需LibreOffice、Python环境或GPU。一个二进制文件,一条命令,各种格式都可以使用。
有需要的朋友可以试试看。
项目基于 MIT 协议开放,感兴趣的同学可以去 GitHub 仓库看看源码和文档。
开源地址:https://github.com/firecrawl/anydoc
既然看到这了,欢迎随手点赞、在看、转发,也可以给我个星标⭐,接收最新的文章,我们下期见!
免责声明:
本文所载程序、技术方法仅面向合法合规的安全研究与教学场景,旨在提升网络安全防护能力,具有明确的技术研究属性。
任何单位或个人未经授权,将本文内容用于攻击、破坏等非法用途的,由此引发的全部法律责任、民事赔偿及连带责任,均由行为人独立承担,本站不承担任何连带责任。
本站内容均为技术交流与知识分享目的发布,若存在版权侵权或其他异议,请通过邮件联系处理,具体联系方式可点击页面上方的联系我。
本文转载自:开源日记 开源日记 开源日记《Firecrawl 又又又开源一个神级 skill ,暴涨 1 万 Star 。》
版权声明
本站仅做备份收录,仅供研究与教学参考之用。
读者将信息用于其他用途的,全部法律及连带责任由读者自行承担,本站不承担任何责任。









评论