Firecrawl 开源了 anydoc,一个 Rust 写的文档解析引擎,MIT 协议。14 种办公文档转 GitHub Flavored Markdown,中位耗时 4.7 毫秒。
对比
100 份真实文档,Claude Sonnet 5 盲评:
|
|
|
|
|
|---|---|---|---|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
唯一覆盖全部格式且评分最高。Mammoth 只支持 DOCX,70 分没参考意义。从覆盖和速度看,Firecrawl优势明显。
不过,PDF 只处理文本层,扫描件 OCR 得走 Firecrawl 托管 API。测试硬件是 Ryzen 9 9950X3D,测试集未公开,真实场景下奇形怪状的编码和损坏文件表现如何还不好说。
怎么做到的
纯 Rust,无 ML 模型,无外部依赖。格式检测靠文件内容而非扩展名,所有格式统一走一个 Document 模型和 GFM 序列化器。
用法
npx @firecrawl/anydoc report.docx # CLI
npm install @firecrawl/anydoc # Node.js
pip install firecrawl-anydoc # Python
cargo add anydoc # Rust
npx skills add firecrawl/anydoc # 作为 Agent Skill
一行命令就能让 Claude Code、Cursor、Codex 直接读本地文档。
这次算是firecrawl为了引流又做出的贡献,感兴趣的可以薅一波。
GitHub: https://github.com/firecrawl/anydoc
关注公众号回复“进群”入群讨论

