AutoResearch: Turning Research into an Auditable Closed-loop System
AutoResearch: Turning Research into an Auditable Closed-loop System
科研自动化很容易被误解成直接跟模型说“帮我写一篇nature”。真正困难的部分,是让每一个结论都能回答:基于哪条假设、用了什么证据、执行了什么代码、失败过什么、为什么改变方向?
这是AutoResearch系统正在形成的范式:把研究拆成一个可追溯、可复盘的闭环——提出假设,收集证据,执行分析,记录失败,修正假设,生成报告,再进入下一轮,不断迭代。
前阵子在做AutoResearch for Social Science方向的探索,做了一些相关领域调研,也深受启发。
三代系统
The AI Scientist: Sakana AI 等人在论文中展示了一个从想法生成开始,自动写代码、运行实验、生成可视化、撰写完整论文,并进行模拟同行评审的框架。论文报告其在扩散模型、Transformer 语言模型和学习动力学三个方向进行验证,单篇论文的生成成本低于 15 美元,并声称自动评审器在评分上接近人类水平。它的关键贡献,是把“研究产物”串成一条可执行管线,即一种端到端流水线。
Dolphin: Dolphin 将流程明确为“Thinking—Practice—Feedback”:先依据相关论文和前轮实验反馈生成想法,再用模板化代码实现。遇到异常时,通过 traceback 引导的局部结构修复代码。最后自动分析结果,并把分析反馈给下一轮想法生成。这一步把线性 pipeline 变成了循环,实验结果变成输入。
AutoResearchClaw: AutoResearchClaw 的设计更接近“研究操作系统”:Structured Multi-Agent Debate负责提出和质疑假设;Self-Healing Executor在失败后进入Pivot或Refine决策;Verifiable Result Reporting阻止虚构数字和引用。人类可以在七种干预模式之间选择。论文在 ARC-Bench上报告相对 AI Scientist v2 提升 54.7%。
一个可审计闭环长什么样?
可以把一次研究运行建模为事件日志,而不是一段聊天记录:
1 | |
每个节点至少应保存五类字段:输入与来源、可执行工件(代码/容器/配置)、输出摘要、置信度与不确定性、以及指向原始日志的链接。这样,报告中的类似“准确率提升 2.1 个百分点”的表述必须能反查到数据快照、评测脚本和运行 ID;“实验失败”也必须有错误栈、重试次数和停止原因。
处理失败
传统自动化常把失败当作要隐藏的噪声。重试几次,直到得到一张好看的图,而闭环系统应把失败分层记录:
- 工具失败:依赖缺失、超时、显存不足——通常可 Refine。
- 实现失败:测试不通过、维度错误、指标脚本不一致——需要保留补丁和回归结果。
- 假设失败:对照实验没有提升,或效果只在单一切分出现——应触发 Pivot。
- 证据失败:论文不可访问、引用与论断不匹配、数据许可不清——降低结论等级。
字体美学&社会科学 AutoResearch
把上述闭环迁移到字体美学和社会科学的相关研究时,研究对象不再只是模型指标,而是“字体形式—社会语境—受众感知”之间的关系。
1 | |
其中,Evidence Agent 负责文献检索与证据整理;Stimulus Agent 把假设转化为可比较的字体刺激材料;Experiment Agent 组织受试者实验;Vision Agent 对招募图片、字体样本或实验材料进行视觉标注;Analysis Agent 处理统计数据;Audit Agent 检查混杂变量、样本偏差和结论越界,最后把审计意见反馈给下一轮假设。
| 智能体 | 典型输入 | 可审计输出 |
|---|---|---|
| 文献检索智能体 | 关键词、研究问题 | 文献摘要、引用、研究空白、来源链接 |
| 假设生成智能体(人在回路) | 文献与初步观察 | 可检验假设,例如“控制词义、版式和颜色后,字体面积/可读性/品牌联想仍与高端感评分相关” |
| 数据采集智能体 | 城市、业态、关键词 | 图片 URL、采集时间、来源、元数据与许可状态 |
| 视觉标注智能体 | 招牌或字体图片 | 文字、语言、颜色、版式、业态等结构化标签 |
| 合成受访者智能体 | persona 与图片 | 不同人群模拟评分;同时标注其仅可作先验或预实验,不能替代真实受试者 |
| 统计分析智能体 | CSV 与预注册分析方案 | 描述统计、相关性、组间比较、效应量、置信区间和图表 |
| 批判审查智能体 | 分析结果 | 混杂变量、样本偏差、测量效度和结论越界提醒 |
| 报告生成智能体 | 全部证据 | 初稿、图表说明、局限性及逐条证据链接 |
字体美学尤其容易受到混杂因素影响:街区阶层、语言文字系统、招牌材质、拍摄时间等等,都可能与字体风格同时变化。因此 Audit Agent 应在报告生成前检查:
- 刺激材料是否只改变字体,而把词义、颜色、版式和图像背景保持不变;
- 受访者样本是否覆盖目标群体,是否存在地域偏差;
- 评分量表是否经过信度检验,合成受访者结果是否被误写成真实社会证据;
- 相关关系是否可以被表述成因果关系,统计显著性是否伴随不确定性;
当审计发现“高端感”差异可能由店铺价格而非字体造成时,系统不应“润色”结论,而应生成 Failure Record,触发新的控制变量、匹配样本或刺激重制。
评估重点
AutoResearch 系统不应只看最终论文的质量。更有意义的指标包括:
- 可重放率:另一台机器能否按记录复现实验和图表?
- 证据覆盖率:每个关键论断是否有直接数据或可靠引用?
- 失败诚实度:失败是否完整记录,报告是否披露负结果?
- 闭环收益:下一轮是否真正使用了上一轮反馈,而非重新随机搜索?
- 人机杠杆:人类在哪些决策点介入,带来了多少质量提升与成本降低?
Conclusion
自动科研必须同时具备争论、自修复、可验证性、记忆和可调节的人类控制。下一阶段的竞争焦点,不是谁能生成更多论文,而是谁能让每个结论都经得起复跑、质疑和追责。
参考文献
- The AI Scientist: Towards Fully Automated Open-Ended Scientific Discovery(arXiv:2408.06292)
- Dolphin: Moving Towards Closed-loop Auto-research through Thinking, Practice, and Feedback(arXiv:2501.03916)
- AutoResearchClaw: Self-Reinforcing Autonomous Research with Human-AI Collaboration(arXiv:2605.20025)