从会回答 · 到能执行
北大团队开源的 Code-as-Action 科研智能体
9.9 元模型入口 · Python/R 持久内核 · 可追溯交付
最近,北京大学袁粒课题组(PKU-YUAN Lab,北大深研院)开源了 OpenAI4S。README 的定位很醒目:用 9.9 元/月的火山方舟 Small 套餐接入豆包,复现 Claude Science 的核心工作方式。
先说清楚:这不是官方性能对标结论,也不等于 9.9 元能包办所有科研任务。它是一个面向科研场景的开源混合式智能体,模型供应商、计算环境和数据来源都可自选。
01
PART
它和普通聊天机器人有什么不同?
ARCHITECTURE · CODE AS ACTION
它的核心不是“再做一个聊天页面”,而是把任务拆成两个动作平面:
JSON 工具负责控制
管理流程、权限与元数据,并处理外部服务和人工审批。
Python/R 内核负责计算
负责读数、清洗、统计、绘图、仿真,并在多轮任务中保留状态。
这种设计叫 Code-as-Action。传统 Agent 要“读文件一次、筛选一次、排序一次、画图一次”,每步都和模型通信一轮;README 的对照是同一任务 ReAct 要十四个来回,OpenAI4S 一个代码单元跑完。大型数据因此留在内核内存里,进对话的只有 <DataFrame 100000×20> 这样一行摘要。
更关键的是,代码单元跑到一半还能反向调用宿主——同步问一次模型、派出子智能体、把重活丢给远程 GPU,再接着往下跑。传统 tool_use 架构里动作是原子的,做不到这件事。
它不只告诉你“应该怎么分析”,而是真去执行。 过程记录在 Action Timeline 里,产出的图表和报告存为带版本与来源信息的 Artifact。
02
PART
它现在能做什么?
CAPABILITY MAP
从当前仓库看,它覆盖了几类高频科研工作:
01 文献与数据检索
连接 UniProt、RCSB PDB、PubChem、arXiv 等公开数据库与网络搜索。
02 本地数据分析
在持久 Python/R 环境里跑统计、机器学习和可视化代码。
03 科研工作流
Skills 覆盖文献综述、PDF 精读、论文叙事、科研配图、实验规划和数据集审计。
04 生命科学任务
内置三十余个 Skill,含 AlphaFold2、ESMFold2、ProteinMPNN、DiffDock、scGPT 等,覆盖蛋白结构、蛋白设计、单细胞与分子对接;重型任务通常需外部 GPU或远程算力。
05 可追溯交付
执行时间线、代码单元、产物版本、环境信息与数据血缘都可查。
它支持火山方舟、OpenAI、Anthropic、Gemini 及兼容接口——是“科研执行框架”,不绑定某一个大模型。
03
PART
最短安装教程
INSTALLATION
截至 2026 年 8 月 7 日,最新正式版本是 v0.1.0。 Apple Silicon Mac 可直接下 .dmg,但该构建未做公证,首次打开会被 Gatekeeper 拦,需手动放行;Linux、Intel Mac 走 PyPI 或源码;Windows 无原生版,Release 里的 zip 是 Linux 构建加一个装进 WSL2 的启动器。
浏览器打开 http://127.0.0.1:8760/ 进入工作台。
源码安装要求 Python 3.10 以上和 uv。要完整 Python+R 内核,再备一个 micromamba/mamba/conda,跑 ./setup.sh --with-kernel-envs。
04
PART
第一次使用,只做三件事
FIRST RUN
打开“设置 → 模型”,选 Ark、OpenAI 或 Anthropic 等协议,填 API Key 并设为当前模型。程序可无 Key 启动,但真要调模型仍需凭证。选 Ark 时 Base URL 和模型 id 都能留空走默认——标题里那 9.9 元就花在这一档,一个火山方舟 Key 同时覆盖豆包、GLM、Kimi、DeepSeek、MiniMax。
打开“设置 → 网络”,确认“允许联网”已开;要实时检索就去 tavily.com 注册个免费 Key 填进去。不填也能搜,走免密钥抓取,但更易被限流。
计算 [4, 8, 15, 16, 23, 42] 的均值,展示计算代码,并提交结果。 先确认代码确实执行、答案可以复算,再进入真实课题。
通过后再上传自己的 CSV,让它做缺失值检查、描述统计、可视化和 Markdown 报告。观察重点不是回答写得多漂亮,而是:代码是否真的执行、图表是否生成、数据来源是否可追溯、结论能否被复核。
///
END
值得尝试,但别把它当“自动发论文机器”
LIMITS · NEXT
项目开源不足两个月,接口、存储结构和界面都还在动。文档把通用远程算力明确标为 Prototype,Web 应用文档另有一张实现状态表,逐项写清哪些已接线、哪些仍是部分完成。路线图上未打勾的也不少:更强的 Linux 隔离、抗限流的免密钥搜索、更多远程算力后端、端到端工作流的公开基准、本地 GPU 模型服务。main 分支进度通常领先于 Release 包,动手前值得再对一眼。
更重要的是,能执行代码不代表结果天然正确。科研使用仍要保留原始数据、固定环境、检查引用、复算关键指标,由领域专家审阅结论。
科研 AI 的下一步,不只是更会说,而是能执行、能记录、能复现、能交付。
想要更多AI使用技巧?回复关键词
B655:nature-skill功能测试
B675:Codex 使用前必做的几个设置:配置、权限和 Skill 一次讲清楚
F424:科研写作与绘图 Skills 汇总推荐
科研小白需安装的 11 个 SKills
B678:文献下载管理与综述Skill安装包:literature-review-workflow
B685:创新点设计与可证伪性检验Skill安装包:paper-novelty-design
B716:Zotero + Obsidian + Codex 联动教程
B721:GPT5.6 (Codex)安装指南和必装skill
B740:GPT做PPT-全流程提示词模板(异常好用)
B754:drawio绘图软件、skill和插件安装包

