AI 智能体在模型开发中承担更多工作,但人类仍做决策
一项来自复旦等团队的研究记录了人类与 AI 智能体协作开发 Atria Dawn Preview 模型的过程。AI 参与 96.5% 的任务,智能体动作与人类输入比从 11 升至 28.5,但人类仍主导方法、参数和目标等关键决策,最终决策占比在 85% 以上。约三分之一 AI 辅助任务若没有 AI 则无法完成,人类判断而非执行成为瓶颈。
原贴
查看原文原文
中文翻译
AI 智能体在模型开发中承担了更多工作,但人类仍然做出决策
一个研究团队记录了一个人类和 AI 智能体如何合作构建一个新 AI 模型的过程。这些发现挑战了关于智能体能够多么独立工作的一些预期。
当 AI 智能体帮助构建新 AI 模型时,谁做出决策?一个包括中国复旦大学研究人员的团队研究了自己的项目来找出答案。
核心信息
一项来自复旦等团队的研究记录了人类与 AI 智能体协作开发 Atria Dawn Preview 模型的过程。AI 参与 96.5% 的任务,智能体动作与人类输入比从 11 升至 28.5,但人类仍主导方法、参数和目标等关键决策,最终决策占比在 85% 以上。约三分之一 AI 辅助任务若没有 AI 则无法完成,人类判断而非执行成为瓶颈。
- 一项来自复旦等团队的研究记录了人类与 AI 智能体协作开发 Atria Dawn Preview 模型的过程。AI 参与 96.5% 的任务,智能体动作与人类输入比从 11 升至 28.5,但人类仍主导方法、参数和目标等关键决策,最终决策占比在 85% 以上。约三分之一 AI 辅助任务若没有 AI 则无法完成,人类判断而非执行成为瓶颈。
- 原贴提到:A research team documented how humans and AI agents worked together to b
- 来源:the-decoder.com
详细解读
这是什么信号
这不是“AI 自己写模型”的宣言,而是一份来自复旦等团队的自研项目日志:他们开发了 Atria Dawn Preview,一个基于混合专家架构、7440 亿参数的 agentic 语言模型,并分析了 56 名参与者、700 多条任务日志以及智能体日志。AI 参与了 96.5% 的任务,智能体动作与人类输入的中位数比从 11 升至 28.5。表面看,agent 的“动作量”在四周内翻倍。
但关键信号是:动作量不等于决策权。人类仍做出 85.5% 的方法和参数决策,AI 仅占 9.2%;在目标和范围上,人类做出 93.4% 的最终决策。最常见的协作模式是“AI 提议、人类选择”,占 55.4%。AI 的提议占比在 17% 到 55% 之间,但最终决策占比始终是个位数。
为什么重要
它纠正了一个常见误读:agent 接手更多步骤,并不等于 agent 获得更多自主性。原文明确提醒,“每个类人决策导致更多智能体步骤”,这更像人类指挥下的执行放大,而不是目标自主。
更重要的发现是 AI 的价值形态。455 个完成的 AI 辅助任务中,151 个被参与者评为“没有 AI 则不可行”,约三分之一,且分布在 56 人中的 27 人,不是少数重度用户。AI 在这类任务中没有加速原有工作,而是让原本不会启动的工作成为可能。与此同时,遇到困难时,76% 的任务靠人类介入推进,但人类帮助主要是补充上下文、澄清需求或诊断问题并切换方法,亲自编辑只占 3.2%,完全接管仅 0.7%。人类判断而非执行,才是瓶颈。
对谁有价值
对 AI 实验室和工程团队:可用于设计人机协作流程,把人类放在目标、方法、参数选择和异常诊断环节,把 agent 放在执行、草拟和试错环节。对 agent 工具与平台开发者:需要支持“AI 提议、人类选择”的交互,记录任务日志、执行环境、外部验证信号和人类干预类型。对管理者:评估 AI 产出时,不能只看任务速度,还要看它是否解锁了原本不可行的任务。对个人:把 AI 当作扩大可行工作集合的协作者,而不是替代判断的决策者。
可以怎么行动
- 在团队内区分“加速现有任务”和“解锁新任务”,分别记录 AI 辅助任务数量与不可行任务占比。
- 把关键决策显式化:目标与范围由人类定,方法和参数采用“AI 提议、人类选择”,并保留最终决策记录。
- 当 agent 卡住时,优先提供上下文、澄清需求或协助诊断,而不是直接接管执行。
- 为 agent 建立真实执行环境和外部验证信号,如测试、指标或来源证据,减少无效动作。
- 跟踪智能体动作与人类输入的比值,但不要把它当作自主性指标;同时跟踪人类最终决策占比。
风险与限制
这是单项目、单团队的研究,56 名参与者、约四周,结论不一定适用于所有组织或任务类型。Atria Dawn Preview 只在 16 项基准中的 5 项领先,包括网络搜索和网络安全,但整体并未超过竞争对手,因此不能把协作模式的成功等同于模型全面领先。文中提到的“递归自我改进”只是推测性第四阶段,作者也指出模型可以在训练任务上变强,却不一定会更擅长开发后继模型。AI 如何提出多样研究方向并在结果出现前评估价值,仍是开放问题。最后,智能体动作增加可能带来更多审查与验证成本,若外部信号不足,人类判断瓶颈会更严重。
信息差价值
这条内容的真正价值,不只是“有人发布了一个新功能”,而是它揭示了 the-decoder.com 背后的产品方向、工作流变化或竞争信号。对 OPC 来说,这种信息可以转化成持续追踪的栏目选题。
如果把《AI 智能体在模型开发中承担更多工作,但人类仍做决策》放到你的内容系统里,它最大的价值在于帮助读者更快看懂“为什么值得关注”,而不是只看到一条碎片化动态。
参考来源
TOPIC HUBS
延伸专题
AI SUMMARY
这篇文章回答了什么
AI 智能体在模型开发中承担更多工作,但人类仍做决策主要讲什么?
一项来自复旦等团队的研究记录了人类与 AI 智能体协作开发 Atria Dawn Preview 模型的过程。AI 参与 96.5% 的任务,智能体动作与人类输入比从 11 升至 28.5,但人类仍主导方法、参数和目标等关键决策,最终决策占比在 85% 以上。约三分之一 AI 辅助任务若没有 AI 则无法完成,人类判断而非执行成为瓶颈。
这篇文章最值得关注的要点是什么?
一项来自复旦等团队的研究记录了人类与 AI 智能体协作开发 Atria Dawn Preview 模型的过程。AI 参与 96.5% 的任务,智能体动作与人类输入比从 11 升至 28.5,但人类仍主导方法、参数和目标等关键决策,最终决策…;原贴提到:A research team documented how humans and AI agents worked together to b;来源:the-decoder.com
这篇文章和哪些AI专题相关?
它适合放在Agent工作流、AI副业、AI工具专题里阅读。 关联原因:这篇内容命中「Agent、智能体」等主题信号。;这篇内容命中「项目、小生意、变现」等主题信号。;这篇内容命中「模型」等主题信号。
阅读这篇文章建议先理解哪些关键词?
建议先理解AI工具、工具、自动化、模型、Cursor这些关键词,再结合正文判断工具、机会或风险是否值得进入自己的工作流。