Science One 框架:通过证据链实现可验证的自主研究框架
Google Cloud 推出 Science One 实验性研究框架和 CoE Audit 审计协议,通过 Chain-of-Evidence 证据链消除 AI 科研中的幻觉引用和不可复现问题,实现零幽灵引用并保持 SOTA 性能。
原贴
查看原文原文
中文翻译
Rui Meng,研究科学家,以及 Tomas Pfister,谷歌云总监。介绍 Science One 框架,一个实验性研究原型,旨在通过原生构建可验证的证据链来消除幻觉,以及 CoE Audit,一种评估 AI 生成论文完整性的自动化协议。
大型语言模型(LLM)不仅作为编码助手,而且作为能够执行端到端科学研究工作流的自主代理被越来越多地部署。最近的系统(例如 Sakana 的 AI-Scientist、AutoResearchClaw、DeepScientist、AI-Researcher)可以审查文献、制定假设、执行实验并写出与人类作者相当的完整手稿。然而,随着这些 AI 生成手稿的表面质量提高,一个关键的结构性问题出现了:可验证性。由于当前的自主研究流水线迭代地生成文本,任何阶段引入的错误都会被放大。一些现有系统可以生成不存在的引用,描述的方法与实际代码之间出现偏差,并报告无法从提供的代码完全复现的实验分数。
在我们的论文中,我们通过引入 Chain-of-Evidence(CoE)来解决这个问题,这是一个用于 AI 驱动研究的新可验证性框架。我们用 Science One Framework(一个原生构建和维护证据链的自主研究原型)以及 CoE Audit(一套自动化评估指标,用于衡量 AI 生成论文与其底层代码和证据的完整性)来实例化 CoE。我们的结果表明,基线系统最多幻觉了 21% 的引用,并且经常使代码和文本错位,而 Science One Framework 实现了零幽灵引用和完全可验证的分数,同时在 MLE-Bench 和 Parameter-Golf 等前沿基准上达到了最先进的性能。
CoE 是一个概念框架,定义了使研究工件可信的条件,就像 ACID 定义了数据库事务可靠的条件一样。该框架不规定如何构建研究代理,而是指定其输出必须具有的属性。它遵循一个原则的两个部分:研究工件中的每个声明必须带有记录的证据链(完整性),并且每条链必须真正支持其所附的声明(正确性)。声明可以是引用、报告的数字、方法描述或结论,必须链接回相应的证据,例如同行评审的论文、实验日志行、实际运行的代码或结果表。幻觉引用指向不存在的论文。不可复现的分数在代码重新运行时不会再次出现。错误描述的方法在论文中声称一种算法,而代码实现的是另一种。每个都是其证据链断裂的声明;CoE Audit 使这些断裂可测量。
为了证明可验证的 AI 研究在不牺牲问题解决性能的情况下是可能的,我们设计了 Science One Framework。与之前生成论文并追溯性尝试链接事实的代理不同,Science One Framework 通过三个主要模块从构造上实例化 CoE 框架:问题调查员(文献接地):为了防止幻觉引用,Science One Framework 通过 Semantic Scholar API 构建引用图。它每个主题最多阅读 100 份全文 PDF 以生成结构化的研究简报。最终论文中的每个引用都源自这个接地的 API 调用,完全消除了对模型记忆的依赖。发现引擎(并行探索-利用):Science One Framework 在多个并行分支中系统地探索和利用想法。在每个隔离的循环中,一个 Solver 代理实现一个解决方案,一个特定于任务的评估器对其进行评分。高性能分支是...
核心信息
Google Cloud 推出 Science One 实验性研究框架和 CoE Audit 审计协议,通过 Chain-of-Evidence 证据链消除 AI 科研中的幻觉引用和不可复现问题,实现零幽灵引用并保持 SOTA 性能。
- Google Cloud 推出 Science One 实验性研究框架和 CoE Audit 审计协议,通过 Chain-of-Evidence 证据链消除 AI 科研中的幻觉引用和不可复现问题,实现零幽灵引用并保持 SOTA 性能。
- 原贴提到:Rui Meng, Research Scientist, and Tomas Pfister, Director, Google Cloud
- 来源:research.google
详细解读
这个信号表明,AI 自主科研正从“能写论文”进入“可验证”的阶段。Google 云推出的 Science One 框架和 CoE Audit 协议,直指当前 AI 科研代理最大的痛点——幻觉引用和不可复现的结果。通过“证据链”设计,让每一个声明都能追溯到原始证据,这不仅是技术改进,更可能成为 AI 科研可信度的基础设施。
为什么重要?因为如果 AI 生成的研究无法验证,就无法真正进入科学共同体。21% 的引用幻觉率意味着传统基线系统会大量编造来源,这会污染学术生态。Science One 通过强制引用数据库和代码-文本对齐,将幻觉降至零,使得 AI 自动化的研究可以被审计、被信任。这类似于数据库领域的 ACID 事务,为 AI 科研制定了原子性、一致性、隔离性、持久性的对应物。
对谁有价值?首先,科研人员可以借助它加速文献综述和实验探索,同时确保成果的可信度。其次,AI 实验室和药企等需要合规的研发流程,能降低 AI 生成结果的风险。第三,学术出版机构可以借鉴 CoE Audit 作为审稿工具,快速检测论文是否存在证据断裂。最后,AI 开发者和研究者需要关注其框架设计,理解如何构建可验证的 agent。
可以怎么行动?如果你是研究者,可以申请试用 Science One 或基于其思想在项目中构建证据链。如果你在学术机构,可以引入 CoE Audit 作为论文质量评估的辅助工具。如果你的团队正在开发 AI agent,应当把“可验证性”作为设计原则,而不是事后打补丁。另外,可以关注 Google 的论文,学习其 Chain-of-Evidence 的具体实现。
风险与限制:Science One 目前仍是实验性原型,可能不适用于所有学科,尤其是需要开放式探索的研究。依赖 Semantic Scholar API 可能限制某些领域资源的覆盖性。而且,证据链只能保证“引用真实”和“代码一致”,并不能保证科学发现的正确性或创新性。此外,框架的算力成本可能很高,每主题阅读 100 篇 PDF 会带来资源消耗。因此,它更适合作为增强可信度的工具,而非完全替代人类科学家的判断。
信息差价值
这条内容的真正价值,不只是“有人发布了一个新功能”,而是它揭示了 research.google 背后的产品方向、工作流变化或竞争信号。对 OPC 来说,这种信息可以转化成持续追踪的栏目选题。
如果把《Science One 框架:通过证据链实现可验证的自主研究框架》放到你的内容系统里,它最大的价值在于帮助读者更快看懂“为什么值得关注”,而不是只看到一条碎片化动态。
参考来源
TOPIC HUBS
延伸专题
AI SUMMARY
这篇文章回答了什么
Science One 框架:通过证据链实现可验证的自主研究框架主要讲什么?
Google Cloud 推出 Science One 实验性研究框架和 CoE Audit 审计协议,通过 Chain-of-Evidence 证据链消除 AI 科研中的幻觉引用和不可复现问题,实现零幽灵引用并保持 SOTA 性能。
这篇文章最值得关注的要点是什么?
Google Cloud 推出 Science One 实验性研究框架和 CoE Audit 审计协议,通过 Chain-of-Evidence 证据链消除 AI 科研中的幻觉引用和不可复现问题,实现零幽灵引用并保持 SOTA 性能。;原贴提到:Rui Meng, Research Scientist, and Tomas Pfister, Director, Google Cloud;来源:research.google
这篇文章和哪些AI专题相关?
它适合放在AI副业、AI工具、Agent工作流专题里阅读。 关联原因:这篇内容命中「项目、小生意、变现」等主题信号。;这篇内容命中「自动化、模型」等主题信号。;这篇内容命中「Agent、智能体」等主题信号。
阅读这篇文章建议先理解哪些关键词?
建议先理解AI工具、工具、自动化、模型、Cursor这些关键词,再结合正文判断工具、机会或风险是否值得进入自己的工作流。