向AI转型的程序员都关注公众号 机器学习AI算法工程
ARIS 是一套用于自主机器学习研究的纯 Markdown 技能集合。它把文献调研、idea 发现、实验自动化、论文写作、同行评审回复串成一条流水线,交给 Claude Code 之类的 LLM Agent 在无人值守时执行。仓库目前包含 82 个可组合技能,每个技能就是一个 SKILL.md 文件。
项目的设计取向是「无框架、零锁定」:技能层全是 Markdown,不依赖数据库、Docker 或守护进程。除了 Claude Code,也可以在 Codex CLI、Cursor、Trae、Antigravity、GitHub Copilot CLI、OpenClaw、DeepSeek Harness 等宿主上运行。作者对此的表述是「ARIS is a methodology, not a platform」。
项目概况
|
|
|
|---|---|
|
|
SKILL.md)
|
|
|
|
|
|
xhigh / ultra),经 Codex MCP 调用
|
|
|
install_aris.sh),可选按组/按技能选择
|
|
|
|
|
|
|
核心机制:跨模型评审循环
ARIS 的流程由两个模型分工完成:一个负责执行,另一个负责批判性评审。默认组合是 Claude Code 执行、GPT-6-Astra 评审(通过 Codex MCP 调用)。
作者给出的理由是:让同一个模型既执行又评审会陷入 local minima——模型审查自己的输出会产生盲区。Claude Code 的优势是执行快、流程顺,Codex 较慢但在批判上更严格,两者是「speed × rigor」的互补。
评审模型的配置与回退:
-
默认评审模型 gpt-6-astra;7 个深度审查技能用ultra推理档位,其余为xhigh。 -
能力回退链: gpt-6-astra→gpt-5.6-sol→gpt-5.5(均为xhigh),账户没有新模型时自动降级,无需配置。 -
可显式指定 — reviewer: oracle-pro,改用 GPT-5.5 Pro(经 Oracle MCP)。 -
Codex 侧镜像方案若仍由 Codex 自审,结果会标记为 same-family / provisional,只有叠加 Claude/Gemini 评审或确定性验证器才会记为accepted。
工作流
技能可单独使用,也可串成完整流水线:
/research-lit → /idea-creator → /novelty-check → /research-refine → /experiment-bridge → /auto-review-loop → /paper-writing → submit → /rebuttal ↕ research-wiki(跨会话持久记忆) /meta-optimize(ARIS 自我改进,独立运行)
|
|
|
|
|---|---|---|
|
|
/idea-discovery |
|
|
|
/experiment-bridge |
|
|
|
/auto-review-loop |
|
|
|
/paper-writing |
|
|
|
/rebuttal |
|
|
|
/resubmit-pipeline |
|
|
|
/paper-talk |
|
|
|
/proof-orchestrator |
|
|
|
/research-wiki init |
|
|
|
/meta-optimize |
|
W1:idea 发现(8 步)
调研现状 → 头脑风暴 8–12 个具体 idea → 按可行性与算力成本过滤 → 深度新颖性校验 + devil's advocate 评审 → 对 top 2–3 个 idea 并行跑 GPU 试点(每个 30 分钟到 2 小时)→ 按实证信号排序 → 把最优 idea 精化为问题锚定的方案 → 规划带消融与预算的实验路线。产出 IDEA_REPORT.md、FINAL_PROPOSAL.md、EXPERIMENT_PLAN.md,并会记录失败方向。
W2:自动评审循环(过夜运行的核心)
流程为四步:GPT-6-Astra 深度评审找出弱点 → Claude 实施修复(改写章节、补 baseline 或跑新实验)→ 收集结果回喂评审者 → 重复,直到分数达到 POSITIVE_THRESHOLD(默认 6/10)或达到 MAX_ROUNDS(默认 4)。
两个实现细节:预计超过 4 GPU 小时的实验会自动跳过并标记人工跟进;上下文窗口写满时会从 REVIEW_STATE.json 自动续跑。
W4:Rebuttal 的三道约束
回复审稿意见时设了三条硬性约束:不编造(每条论断都能对应到论文/审稿意见/用户确认的结果)、不过度承诺(每项承诺都经用户确认)、全覆盖(每条审稿意见都被跟踪)。输出两个文件:PASTE_READY.txt(精确控制字符数,可直接粘贴)和 REBUTTAL_DRAFT_rich.md(供手动编辑的扩展版)。
常用参数:venue(默认 ICML)、character limit(必填)、quick mode(只做解析与策略,不起草)、auto experiment(审稿人要求新证据时自动补实验)、max stress test rounds(默认 1)、max followup rounds(默认 3)。
一次真实过夜运行的分数变化
README 记录了一次 4 轮自动循环的实际结果,分数从 5.0/10 提升到 7.5/10,期间自主跑了 20+ GPU 实验:
|
|
|
|
|---|---|---|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
这个过程中 Round 2 和 Round 3 都是模型自己发现 claim 站不住并主动转向——项目的价值点在于「会推翻自己」,而不只是「会写」。
安装与上手
先决条件
- Claude Code
(或其他宿主)。 - Codex CLI
——评审技能通过它调用 GPT。需 npm install -g @openai/codex并codex login,评审模型取自~/.codex/config.toml。 - LaTeX
——仅 W3 论文写作需要( latexmk+pdfinfo)。只用 W1/W2 则不需要。Windows 用 MiKTeX 或 TeX Live,并单独装 Poppler 把pdfinfo.exe加进 PATH。
1. 安装技能
git clone https://github.com/wanshuiyin/Auto-claude-code-research-in-sleep.git bash Auto-claude-code-research-in-sleep/tools/install_aris.sh ~/your-project # 项目级软链接到/.claude/skills/,清单记录在 .aris/installed-skills.txt # 全局安装:cp -r Auto-claude-code-research-in-sleep/skills/* ~/.claude/skills/ # 不需要全部 82 个:--list-groups / --groups X,Y / --skills X
2. 注册 Codex 评审者(新安装)
npm install -g @openai/codex && codex login claude mcp add codex -s user -- python3 "$(pwd)/Auto-claude-code-research-in-sleep/mcp-servers/codex-exec/server.py" # 重启 Claude Code,用 claude mcp list 确认: # codex: python3 …/codex-exec/server.py - ✔ Connected
2b. 已在 2026-09-11 前安装过(MCP 重新注册)
cd Auto-claude-code-research-in-sleep && git pull claude mcp remove codex -s user claude mcp add codex -s user -- python3 "$(pwd)/mcp-servers/codex-exec/server.py" # 重启并检查 claude mcp list;技能本身无需改动
3. 常用命令
# 在 Claude Code 中执行 /idea-discovery "factorized gap in discrete diffusion LMs" # 方向要具体,不要只写 "NLP" /experiment-bridge # 有计划?实现 + 部署 + 收结果 /auto-review-loop "your paper topic" # 过夜:评审 → 修复 → 再评审 /paper-writing "NARRATIVE_REPORT.md" # 叙事 → PDF /rebuttal "paper/ + reviews" — venue: ICML, character limit: 5000 /research-pipeline "your research direction" # W1 → 1.5 → 2 → 3 全链路 /research-wiki init # 开启持久记忆(一次性) /meta-optimize # 分析日志,提出技能改进
更新与卸载
cd Auto-claude-code-research-in-sleep && git pull bash tools/smart_update.sh --apply # 更新安全技能,并标记你的个人改动 # 卸载(不影响你自己的技能) cd Auto-claude-code-research-in-sleep && ls skills/ | xargs -I{} rm -rf ~/.claude/skills/{}
常用参数
所有流水线行为都可用 — key: value 内联覆盖,共 16 个参数。常用的几个:
|
|
|
|
|---|---|---|
effort |
|
lite 0.4x / balanced / max 2.5x / beast 5–8x
|
difficulty |
|
medium / hard / nightmare
|
gpu |
|
local
remote(SSH)/ vast(Vast.ai 按需租用)
|
human checkpoint |
|
|
AUTO_PROCEED |
|
|
DBLP_BIBTEX |
|
|
code review |
|
|
ref paper
base repo
|
|
|
sources |
|
zotero/obsidian/local/web/semantic-scholar/deepxiv/exa/gemini/openalex
|
定向改进的用法示例(给定论文 + 代码库):
/research-pipeline "improve method X" — ref paper: https://arxiv.org/abs/2406.04329, base repo: https://github.com/org/project
没有 Claude / OpenAI API 也能用
ARIS 提供 10 条替代模型路线,保持同样的跨模型架构:Z.ai GLM、阿里云系(Kimi / Qwen / MiniMax)、经 ModelScope 的免费 DeepSeek-V3.1、OpenRouter 作为评审后端、Codex 执行 + Claude/Gemini 评审、Google Antigravity 等。完整的路由表与逐条配置见仓库 docs/MODEL_COMBINATIONS.md。
在 DeepSeek Harness 上可作为一个插件安装:dsh plugin --profile web add dsh-aris(自行从 npm 拉取,无需额外安装步骤,但 pnpm 需在 PATH 上)。此外还有 Rust 写的独立 CLI 版本 ARIS-Code,以及一个 macOS 上的 Tkinter 悬浮监控小窗 aris-monitor/(会话等待审批时亮红点,点击跳转终端)。
机器学习算法AI大数据技术
搜索公众号添加: datanlp
长按图片,识别二维码
阅读过本文的人还看了以下文章:
【模型高效部署】tensorrtx 深度解读,yolov11高性能推理实战案例
实时语义分割ENet算法,提取书本/票据边缘
整理开源的中文大语言模型,以规模较小、可私有化部署、训练成本较低的模型为主
《大语言模型》PDF下载
动手学深度学习-(李沐)PyTorch版本
基于40万表格数据集TableBank,用MaskRCNN做表格检测
《基于深度学习的自然语言处理》中/英PDF
Deep Learning 中文版初版-周志华团队
【全套视频课】最全的目标检测算法系列讲解,通俗易懂!
《深度学习入门:基于Python的理论与实现》高清中文PDF+源码
python就业班学习视频,从入门到实战项目
2019最新《PyTorch自然语言处理》英、中文版PDF+源码
《21个项目玩转深度学习:基于TensorFlow的实践详解》完整版PDF+附书代码
《深度学习之pytorch》pdf+附书源码
《Python数据分析与挖掘实战》PDF+完整源码
不断更新资源
深度学习、机器学习、数据分析、python
搜索公众号添加: datayx

