AutoResearch: Turning Research into an Auditable Closed-loop System

AutoResearch: Turning Research into an Auditable Closed-loop System

科研自动化很容易被误解成直接跟模型说“帮我写一篇nature”。真正困难的部分,是让每一个结论都能回答:基于哪条假设、用了什么证据、执行了什么代码、失败过什么、为什么改变方向?

这是AutoResearch系统正在形成的范式:把研究拆成一个可追溯、可复盘的闭环——提出假设,收集证据,执行分析,记录失败,修正假设,生成报告,再进入下一轮,不断迭代。

前阵子在做AutoResearch for Social Science方向的探索,做了一些相关领域调研,也深受启发。

三代系统

The AI Scientist: Sakana AI 等人在论文中展示了一个从想法生成开始,自动写代码、运行实验、生成可视化、撰写完整论文,并进行模拟同行评审的框架。论文报告其在扩散模型、Transformer 语言模型和学习动力学三个方向进行验证,单篇论文的生成成本低于 15 美元,并声称自动评审器在评分上接近人类水平。它的关键贡献,是把“研究产物”串成一条可执行管线,即一种端到端流水线。

Dolphin: Dolphin 将流程明确为“Thinking—Practice—Feedback”:先依据相关论文和前轮实验反馈生成想法,再用模板化代码实现。遇到异常时,通过 traceback 引导的局部结构修复代码。最后自动分析结果,并把分析反馈给下一轮想法生成。这一步把线性 pipeline 变成了循环,实验结果变成输入。

AutoResearchClaw: AutoResearchClaw 的设计更接近“研究操作系统”:Structured Multi-Agent Debate负责提出和质疑假设;Self-Healing Executor在失败后进入Pivot或Refine决策;Verifiable Result Reporting阻止虚构数字和引用。人类可以在七种干预模式之间选择。论文在 ARC-Bench上报告相对 AI Scientist v2 提升 54.7%。

一个可审计闭环长什么样?

可以把一次研究运行建模为事件日志,而不是一段聊天记录:

1
2
3
4
5
6
7
8
9
Hypothesis
↓(检索、引用、数据版本)
Evidence Pack
↓(环境、参数、随机种子、代码提交)
Experiment Run ──失败──→ Failure Record
↓成功 ↓分类:工具/假设/数据/资源
Analysis & Uncertainty ←─┘
↓
Hypothesis Update → Report → 下一轮

每个节点至少应保存五类字段:输入与来源、可执行工件(代码/容器/配置)、输出摘要、置信度与不确定性、以及指向原始日志的链接。这样,报告中的类似“准确率提升 2.1 个百分点”的表述必须能反查到数据快照、评测脚本和运行 ID;“实验失败”也必须有错误栈、重试次数和停止原因。

处理失败

传统自动化常把失败当作要隐藏的噪声。重试几次,直到得到一张好看的图,而闭环系统应把失败分层记录:

  • 工具失败:依赖缺失、超时、显存不足——通常可 Refine。
  • 实现失败:测试不通过、维度错误、指标脚本不一致——需要保留补丁和回归结果。
  • 假设失败:对照实验没有提升,或效果只在单一切分出现——应触发 Pivot。
  • 证据失败:论文不可访问、引用与论断不匹配、数据许可不清——降低结论等级。

字体美学&社会科学 AutoResearch

把上述闭环迁移到字体美学和社会科学的相关研究时,研究对象不再只是模型指标,而是“字体形式—社会语境—受众感知”之间的关系。

1
2
Evidence Agent → Stimulus Agent → Experiment Agent
→ Vision Agent → Analysis Agent → Audit Agent

其中,Evidence Agent 负责文献检索与证据整理;Stimulus Agent 把假设转化为可比较的字体刺激材料;Experiment Agent 组织受试者实验;Vision Agent 对招募图片、字体样本或实验材料进行视觉标注;Analysis Agent 处理统计数据;Audit Agent 检查混杂变量、样本偏差和结论越界,最后把审计意见反馈给下一轮假设。

智能体 典型输入 可审计输出
文献检索智能体 关键词、研究问题 文献摘要、引用、研究空白、来源链接
假设生成智能体(人在回路) 文献与初步观察 可检验假设,例如“控制词义、版式和颜色后,字体面积/可读性/品牌联想仍与高端感评分相关”
数据采集智能体 城市、业态、关键词 图片 URL、采集时间、来源、元数据与许可状态
视觉标注智能体 招牌或字体图片 文字、语言、颜色、版式、业态等结构化标签
合成受访者智能体 persona 与图片 不同人群模拟评分;同时标注其仅可作先验或预实验,不能替代真实受试者
统计分析智能体 CSV 与预注册分析方案 描述统计、相关性、组间比较、效应量、置信区间和图表
批判审查智能体 分析结果 混杂变量、样本偏差、测量效度和结论越界提醒
报告生成智能体 全部证据 初稿、图表说明、局限性及逐条证据链接

字体美学尤其容易受到混杂因素影响:街区阶层、语言文字系统、招牌材质、拍摄时间等等,都可能与字体风格同时变化。因此 Audit Agent 应在报告生成前检查:

  • 刺激材料是否只改变字体,而把词义、颜色、版式和图像背景保持不变;
  • 受访者样本是否覆盖目标群体,是否存在地域偏差;
  • 评分量表是否经过信度检验,合成受访者结果是否被误写成真实社会证据;
  • 相关关系是否可以被表述成因果关系,统计显著性是否伴随不确定性;

当审计发现“高端感”差异可能由店铺价格而非字体造成时,系统不应“润色”结论,而应生成 Failure Record,触发新的控制变量、匹配样本或刺激重制。

评估重点

AutoResearch 系统不应只看最终论文的质量。更有意义的指标包括:

  1. 可重放率:另一台机器能否按记录复现实验和图表?
  2. 证据覆盖率:每个关键论断是否有直接数据或可靠引用?
  3. 失败诚实度:失败是否完整记录,报告是否披露负结果?
  4. 闭环收益:下一轮是否真正使用了上一轮反馈,而非重新随机搜索?
  5. 人机杠杆:人类在哪些决策点介入,带来了多少质量提升与成本降低?

Conclusion

自动科研必须同时具备争论、自修复、可验证性、记忆和可调节的人类控制。下一阶段的竞争焦点,不是谁能生成更多论文,而是谁能让每个结论都经得起复跑、质疑和追责。

参考文献

  1. The AI Scientist: Towards Fully Automated Open-Ended Scientific Discovery(arXiv:2408.06292)
  2. Dolphin: Moving Towards Closed-loop Auto-research through Thinking, Practice, and Feedback(arXiv:2501.03916)
  3. AutoResearchClaw: Self-Reinforcing Autonomous Research with Human-AI Collaboration(arXiv:2605.20025)

AutoResearch: Turning Research into an Auditable Closed-loop System
http://chenjiayi0505.github.io/2026/08/02/AutoResearch:Turing Research into an auditable Closed-loop System/
Author
Jiayi Chen
Posted on
August 2, 2026
Updated on
September 16, 2026
Licensed under