大数跨境

全自动科研工具ARIS:只需提出一个研究方向,自主跑完研究流水线

全自动科研工具ARIS:只需提出一个研究方向,自主跑完研究流水线 机器学习AI算法工程
2026-09-12
9
导读:向AI转型的程序员都关注公众号 机器学习AI算法工程
图片

向AI转型的程序员都关注公众号 机器学习AI算法工程


ARIS 是一套用于自主机器学习研究的纯 Markdown 技能集合。它把文献调研、idea 发现、实验自动化、论文写作、同行评审回复串成一条流水线,交给 Claude Code 之类的 LLM Agent 在无人值守时执行。仓库目前包含 82 个可组合技能,每个技能就是一个 SKILL.md 文件。

项目的设计取向是「无框架、零锁定」:技能层全是 Markdown,不依赖数据库、Docker 或守护进程。除了 Claude Code,也可以在 Codex CLI、Cursor、Trae、Antigravity、GitHub Copilot CLI、OpenClaw、DeepSeek Harness 等宿主上运行。作者对此的表述是「ARIS is a methodology, not a platform」。

项目概况

项目
说明
技能数量
82 个(每个为单个 SKILL.md
执行者(Executor)
Claude Code,或 Codex CLI / Cursor / Trae / Copilot CLI / OpenClaw 等
评审者(Reviewer)
默认 GPT-6-Astra(xhigh / ultra),经 Codex MCP 调用
技能安装方式
项目级软链接(install_aris.sh),可选按组/按技能选择
覆盖环节
文献 → idea → 实验 → 评审循环 → 写作 → rebuttal → Slides/Poster
协议
MIT

核心机制:跨模型评审循环

ARIS 的流程由两个模型分工完成:一个负责执行,另一个负责批判性评审。默认组合是 Claude Code 执行、GPT-6-Astra 评审(通过 Codex MCP 调用)。

作者给出的理由是:让同一个模型既执行又评审会陷入 local minima——模型审查自己的输出会产生盲区。Claude Code 的优势是执行快、流程顺,Codex 较慢但在批判上更严格,两者是「speed × rigor」的互补。

评审模型的配置与回退:

  • 默认评审模型 gpt-6-astra;7 个深度审查技能用 ultra 推理档位,其余为 xhigh
  • 能力回退链:gpt-6-astra → gpt-5.6-sol → gpt-5.5(均为 xhigh),账户没有新模型时自动降级,无需配置。
  • 可显式指定 — reviewer: oracle-pro,改用 GPT-5.5 Pro(经 Oracle MCP)。
  • Codex 侧镜像方案若仍由 Codex 自审,结果会标记为 same-family / provisional,只有叠加 Claude/Gemini 评审或确定性验证器才会记为 accepted

工作流

技能可单独使用,也可串成完整流水线:

/research-lit → /idea-creator → /novelty-check → /research-refine   → /experiment-bridge → /auto-review-loop → /paper-writing   → submit → /rebuttal                      ↕ research-wiki(跨会话持久记忆)                     /meta-optimize(ARIS 自我改进,独立运行)
工作流
入口命令
作用
W1 Idea Discovery
/idea-discovery
调研 → 头脑风暴 8–12 个 idea → 新颖性校验 → GPU 试点 → 排序
W1.5 Experiment Bridge
/experiment-bridge
把实验计划变成可运行代码:实现 → 代码评审 → 冒烟测试 → 部署 → 收结果
W2 Auto Research Loop
/auto-review-loop
评审 → 修复 → 再评审的自动循环,可过夜运行
W3 Paper Writing
/paper-writing
叙事 → 大纲 → 配图 → LaTeX → PDF → 自动评审
W4 Rebuttal
/rebuttal
解析审稿意见 → 起草回复 → 多轮追问
W5 Resubmit
/resubmit-pipeline
把论文改投新会议(纯文本,不新增实验)
W6 Conference Talk
/paper-talk
论文 → Beamer + PPTX + 讲稿
W7 Proof Orchestrator
/proof-orchestrator
跨会话的定理证明战役
Wiki
/research-wiki init
建立跨会话持久记忆(论文/idea/实验/claim)
M Meta-Optimize
/meta-optimize
分析使用日志 → 提出技能改进建议

W1:idea 发现(8 步)

调研现状 → 头脑风暴 8–12 个具体 idea → 按可行性与算力成本过滤 → 深度新颖性校验 + devil's advocate 评审 → 对 top 2–3 个 idea 并行跑 GPU 试点(每个 30 分钟到 2 小时)→ 按实证信号排序 → 把最优 idea 精化为问题锚定的方案 → 规划带消融与预算的实验路线。产出 IDEA_REPORT.mdFINAL_PROPOSAL.mdEXPERIMENT_PLAN.md,并会记录失败方向。

W2:自动评审循环(过夜运行的核心)

流程为四步:GPT-6-Astra 深度评审找出弱点 → Claude 实施修复(改写章节、补 baseline 或跑新实验)→ 收集结果回喂评审者 → 重复,直到分数达到 POSITIVE_THRESHOLD(默认 6/10)或达到 MAX_ROUNDS(默认 4)。

两个实现细节:预计超过 4 GPU 小时的实验会自动跳过并标记人工跟进;上下文窗口写满时会从 REVIEW_STATE.json 自动续跑。

W4:Rebuttal 的三道约束

回复审稿意见时设了三条硬性约束:不编造(每条论断都能对应到论文/审稿意见/用户确认的结果)、不过度承诺(每项承诺都经用户确认)、全覆盖(每条审稿意见都被跟踪)。输出两个文件:PASTE_READY.txt(精确控制字符数,可直接粘贴)和 REBUTTAL_DRAFT_rich.md(供手动编辑的扩展版)。

常用参数:venue(默认 ICML)、character limit(必填)、quick mode(只做解析与策略,不起草)、auto experiment(审稿人要求新证据时自动补实验)、max stress test rounds(默认 1)、max followup rounds(默认 3)。

一次真实过夜运行的分数变化

README 记录了一次 4 轮自动循环的实际结果,分数从 5.0/10 提升到 7.5/10,期间自主跑了 20+ GPU 实验:

轮次
分数
发生了什么
初始
5.0/10
borderline reject
Round 1
6.5/10
补充标准指标,发现指标解耦现象
Round 2
6.8/10
关键 claim 未能复现,调整叙事
Round 3
7.0/10
大种子实验否定了主要改进 claim
Round 4
7.5/10
诊断性证据稳固,标记 submission ready

这个过程中 Round 2 和 Round 3 都是模型自己发现 claim 站不住并主动转向——项目的价值点在于「会推翻自己」,而不只是「会写」。

安装与上手

先决条件

  1. Claude Code
    (或其他宿主)。
  2. Codex CLI
    ——评审技能通过它调用 GPT。需 npm install -g @openai/codex 并 codex login,评审模型取自 ~/.codex/config.toml
  3. LaTeX
    ——仅 W3 论文写作需要(latexmk + pdfinfo)。只用 W1/W2 则不需要。Windows 用 MiKTeX 或 TeX Live,并单独装 Poppler 把 pdfinfo.exe 加进 PATH。

1. 安装技能

git clone https://github.com/wanshuiyin/Auto-claude-code-research-in-sleep.git bash Auto-claude-code-research-in-sleep/tools/install_aris.sh ~/your-project # 项目级软链接到
  
  
  
  /.claude/skills/,清单记录在 .aris/installed-skills.txt # 全局安装:cp -r Auto-claude-code-research-in-sleep/skills/* ~/.claude/skills/ # 不需要全部 82 个:--list-groups / --groups X,Y / --skills X
 
 
 
 

2. 注册 Codex 评审者(新安装)

npm install -g @openai/codex && codex login claude mcp add codex -s user -- python3 "$(pwd)/Auto-claude-code-research-in-sleep/mcp-servers/codex-exec/server.py" # 重启 Claude Code,用 claude mcp list 确认: #   codex: python3 …/codex-exec/server.py - ✔ Connected

2b. 已在 2026-09-11 前安装过(MCP 重新注册)

cd Auto-claude-code-research-in-sleep && git pull claude mcp remove codex -s user claude mcp add codex -s user -- python3 "$(pwd)/mcp-servers/codex-exec/server.py" # 重启并检查 claude mcp list;技能本身无需改动

3. 常用命令

# 在 Claude Code 中执行 /idea-discovery "factorized gap in discrete diffusion LMs"   # 方向要具体,不要只写 "NLP" /experiment-bridge                                            # 有计划?实现 + 部署 + 收结果 /auto-review-loop "your paper topic"                          # 过夜:评审 → 修复 → 再评审 /paper-writing "NARRATIVE_REPORT.md"                          # 叙事 → PDF /rebuttal "paper/ + reviews" — venue: ICML, character limit: 5000 /research-pipeline "your research direction"                  # W1 → 1.5 → 2 → 3 全链路 /research-wiki init                                           # 开启持久记忆(一次性) /meta-optimize                                                # 分析日志,提出技能改进

更新与卸载

cd Auto-claude-code-research-in-sleep && git pull bash tools/smart_update.sh --apply     # 更新安全技能,并标记你的个人改动  # 卸载(不影响你自己的技能) cd Auto-claude-code-research-in-sleep && ls skills/ | xargs -I{} rm -rf ~/.claude/skills/{}

常用参数

所有流水线行为都可用 — key: value 内联覆盖,共 16 个参数。常用的几个:

参数
默认
作用
effort
balanced
强度:lite 0.4x / balanced / max 2.5x / beast 5–8x
difficulty
medium
评审对抗强度:medium / hard / nightmare
gpu
local
local
 / remote(SSH)/ vast(Vast.ai 按需租用)
human checkpoint
false
每轮评审后暂停,便于人工介入
AUTO_PROCEED
true
选择点是否自动继续;设 false 则在投入 GPU 前询问
DBLP_BIBTEX
true
从 DBLP/CrossRef 取真实 BibTeX,消除幻觉引用
code review
true
实验代码上 GPU 前先过一次跨模型评审
ref paper
 / base repo
false
指定参考论文 / 基础代码库,做定向改进
sources
all
文献来源:zotero/obsidian/local/web/semantic-scholar/deepxiv/exa/gemini/openalex

定向改进的用法示例(给定论文 + 代码库):

/research-pipeline "improve method X" — ref paper: https://arxiv.org/abs/2406.04329, base repo: https://github.com/org/project

没有 Claude / OpenAI API 也能用

ARIS 提供 10 条替代模型路线,保持同样的跨模型架构:Z.ai GLM、阿里云系(Kimi / Qwen / MiniMax)、经 ModelScope 的免费 DeepSeek-V3.1、OpenRouter 作为评审后端、Codex 执行 + Claude/Gemini 评审、Google Antigravity 等。完整的路由表与逐条配置见仓库 docs/MODEL_COMBINATIONS.md

在 DeepSeek Harness 上可作为一个插件安装:dsh plugin --profile web add dsh-aris(自行从 npm 拉取,无需额外安装步骤,但 pnpm 需在 PATH 上)。此外还有 Rust 写的独立 CLI 版本 ARIS-Code,以及一个 macOS 上的 Tkinter 悬浮监控小窗 aris-monitor/(会话等待审批时亮红点,点击跳转终端)。


机器学习算法AI大数据技术

 搜索公众号添加: datanlp

图片

长按图片,识别二维码


阅读过本文的人还看了以下文章:


YOLO实时定位,Qwen3-VL-Seg深度诊断,两者协同完成从"看见"到"看懂"再到"审断"的AI质检全链路
GPT-4o做大脑,Qwen2-VL做眼睛,让无人机+无人船自动巡检港口
NVIDIA开源LocateAnything深度解读:3B参数,比Qwen3-VL快10倍,最强3B视觉定位大模型来了
本地部署AI Agent,6G显存跑Qwen3.6-35B-A3B 从入门到实战全流程
TexMS-YOLO:纹理感知特征融合 + 多尺度交互实现工业缺陷检测91.99% mAP
汇集所有大模型架构图!大模型架构演进全解析
98%准确率!这个双分支AI模型,精准识别木薯叶病害(附代码)
2026论文解读,ASAHI:自适应切片助力小目标检测,速度提升25%、精度创新高
TexMS-YOLO:纹理感知特征融合 + 多尺度交互实现工业缺陷检测91.99% mAP
14.7M参数,小目标AP达到13.9%!FSDETR用频空融合重新定义目标检测
skill刚开源就斩获 1.7K Star!web-access让AI真正"上网"
Qwen3.5实战教程:从0到1掌握本地部署与微调
引入小目标注意力模块改进YOLO12用于无人机视角下的岸边人员玩水检测
pdf2skill:让计算机视觉初学者把PDF文档变成AI技能包
next-ai-draw-io 用这款AI 画图几十秒就搞定了
10 万文档 RAG 落地实战:从 Demo 到生产,我踩过的所有坑
最强一键抠图19Kstar 的 Rembg 开源神器
YOLO12改进引入DINOv3少样本目标检测精度飙升,分享训练自定义数据集代码
基于DINOv2和SAM2改进的U-Net模型
Ultralytics & lightly-train:简化计算机视觉模型训练,无需标签
最新视觉大模型 DINOv3论文精读(逐段解析)
医学影像数据集汇总(持续更新)150个
【医学影像分割】UN-SAM:一种高效且通用的细胞核分割模型
小目标检测难点分析和解决策略

【模型高效部署】tensorrtx 深度解读,yolov11高性能推理实战案例

实时语义分割ENet算法,提取书本/票据边缘


整理开源的中文大语言模型,以规模较小、可私有化部署、训练成本较低的模型为主


《大语言模型》PDF下载


动手学深度学习-(李沐)PyTorch版本


基于40万表格数据集TableBank,用MaskRCNN做表格检测


《基于深度学习的自然语言处理》中/英PDF


Deep Learning 中文版初版-周志华团队


【全套视频课】最全的目标检测算法系列讲解,通俗易懂!


《深度学习入门:基于Python的理论与实现》高清中文PDF+源码


python就业班学习视频,从入门到实战项目


2019最新《PyTorch自然语言处理》英、中文版PDF+源码


《21个项目玩转深度学习:基于TensorFlow的实践详解》完整版PDF+附书代码


《深度学习之pytorch》pdf+附书源码


《Python数据分析与挖掘实战》PDF+完整源码



不断更新资源

深度学习、机器学习、数据分析、python

 搜索公众号添加: datayx  

图片

【声明】内容源于网络
0
0
机器学习AI算法工程
计算机视觉、自然语言处理、推荐系统、人工智能、大模型、深度学习、机器学习、大数据技术社区,分享各类算法原理与源码、数据处理、可视化、爬虫、竞赛开源代码等资源。
内容 1571
粉丝 1
机器学习AI算法工程 计算机视觉、自然语言处理、推荐系统、人工智能、大模型、深度学习、机器学习、大数据技术社区,分享各类算法原理与源码、数据处理、可视化、爬虫、竞赛开源代码等资源。
总阅读43.2k
粉丝1
内容1.6k