大数跨境

Unstract:告别正则表达式,用自然语言从PDF里提取JSON

Unstract:告别正则表达式,用自然语言从PDF里提取JSON AI工程化
2026-07-31
1

一堆发票、银行流水、KYC 表单、税务文件堆在桌上,你需要的只是把它们变成数据库里整齐的 JSON。

以前的做法:写正则、做模板、针对每个供应商格式训练模型。或者花钱买商业 API。

现在有个开源项目叫 Unstract,来自 Zipstack。它直接拿 LLM 来干这件事——你把文档丢过去,它返回 JSON。

一句话:用自然语言描述你想要的字段,其他交给 LLM

什么场景用

财务、保险、医疗、KYC/合规——任何需要从非结构化文档里提取数据的团队。

怎么玩

Prompt Studio 是核心。你写一段提示词,定义提取 schema,比如“发票总金额、发票日期、供应商名称”,然后跑起来。

支持 PDF、图片、扫描件,甚至手写体(取决于 LLM 能力)。

输出是干净的 JSON,可以直接塞进数据库。

部署方式

  • API 部署:发一个 REST 请求,拿 JSON 回来。
  • ETL 管道:从文件夹拉取文档,处理完自动写入数据仓库。
  • MCP 服务:对接 Claude 等 AI 代理。
  • n8n 节点:直接插入现有自动化流程。

支持的 LLM 和数据源

几乎通吃:OpenAI、Anthropic、Bedrock、Gemini、Mistral、Ollama(本地)……

输出目标:S3、GCS、Snowflake、BigQuery、Postgres、MySQL 等。

架构速览

┌────────────────────────────────────────────────────────────┐
│ Unstract │
├─────────────┬─────────────┬─────────────┬──────────────────┤
│ Frontend │ Backend │ Worker │ Platform Service │
│ (React) │ (Django) │ (Celery) │ (FastAPI) │
├─────────────┴─────────────┴─────────────┴──────────────────┤
│ Cache (Redis) │
├────────────────────────────────────────────────────────────┤
│ Message Queue (RabbitMQ) │
├────────────────────────────────────────────────────────────┤
│ Database (PostgreSQL) │
├────────────────────────────────────────────────────────────┤
│ LLM Adapters │ Vector DBs │ Text Extractors │
│ (OpenAI, etc.) │ (Qdrant, etc.) │ (LLMWhisperer) │
└────────────────────────────────────────────────────────────┘

快速启动(5分钟)

git clone https://github.com/Zipstack/unstract.git
cd unstract
./run-platform.sh

然后浏览器访问 http://frontend.unstract.localhost,用户名/密码都是 unstract

如果你还在用正则从 PDF 抠数据,值得试试。

仓库地址:https://github.com/Zipstack/unstract

关注公众号回复“进群”入群讨论

【声明】内容源于网络
0
0
AI工程化
专注于AI领域(大模型、MLOPS/LLMOPS 、AI应用开发、AI infra)前沿产品技术信息和实践经验分享。
内容 633
粉丝 0
AI工程化 专注于AI领域(大模型、MLOPS/LLMOPS 、AI应用开发、AI infra)前沿产品技术信息和实践经验分享。
总阅读4.3k
粉丝0
内容633