一堆发票、银行流水、KYC 表单、税务文件堆在桌上,你需要的只是把它们变成数据库里整齐的 JSON。
以前的做法:写正则、做模板、针对每个供应商格式训练模型。或者花钱买商业 API。
现在有个开源项目叫 Unstract,来自 Zipstack。它直接拿 LLM 来干这件事——你把文档丢过去,它返回 JSON。
一句话:用自然语言描述你想要的字段,其他交给 LLM。
什么场景用
财务、保险、医疗、KYC/合规——任何需要从非结构化文档里提取数据的团队。
怎么玩
Prompt Studio 是核心。你写一段提示词,定义提取 schema,比如“发票总金额、发票日期、供应商名称”,然后跑起来。
支持 PDF、图片、扫描件,甚至手写体(取决于 LLM 能力)。
输出是干净的 JSON,可以直接塞进数据库。
部署方式
- API 部署:发一个 REST 请求,拿 JSON 回来。
- ETL 管道:从文件夹拉取文档,处理完自动写入数据仓库。
- MCP 服务器:对接 Claude 等 AI 代理。
- n8n 节点:直接插入现有自动化流程。
支持的 LLM 和数据源
几乎通吃:OpenAI、Anthropic、Bedrock、Gemini、Mistral、Ollama(本地)……
输出目标:S3、GCS、Snowflake、BigQuery、Postgres、MySQL 等。
架构速览
┌────────────────────────────────────────────────────────────┐
│ Unstract │
├─────────────┬─────────────┬─────────────┬──────────────────┤
│ Frontend │ Backend │ Worker │ Platform Service │
│ (React) │ (Django) │ (Celery) │ (FastAPI) │
├─────────────┴─────────────┴─────────────┴──────────────────┤
│ Cache (Redis) │
├────────────────────────────────────────────────────────────┤
│ Message Queue (RabbitMQ) │
├────────────────────────────────────────────────────────────┤
│ Database (PostgreSQL) │
├────────────────────────────────────────────────────────────┤
│ LLM Adapters │ Vector DBs │ Text Extractors │
│ (OpenAI, etc.) │ (Qdrant, etc.) │ (LLMWhisperer) │
└────────────────────────────────────────────────────────────┘
快速启动(5分钟)
git clone https://github.com/Zipstack/unstract.git
cd unstract
./run-platform.sh
然后浏览器访问 http://frontend.unstract.localhost,用户名/密码都是 unstract。
如果你还在用正则从 PDF 抠数据,值得试试。
仓库地址:https://github.com/Zipstack/unstract
关注公众号回复“进群”入群讨论

