论文速读:The Long-Horizon Task Mirage? Diagnosing Where and Why,提升开发者接入体验
大语言模型智能体在短中期任务上表现优异,但在需要长时间、相互依赖动作序列的长时任务上经常失败。尽管智能体系统进步迅速,但这些长时失败仍未得到良好表征,阻碍了跨领域的系统诊断和比较。为此,我们引入HORIZON,一个初步的跨领域诊断基准,用于系统构建任务并分析LLM智能体的长时失败行为。利用HORIZON,我们评估了多个模型系列(GPT-5变体和Claude模型)的先进智能体,收集了3100多条轨迹,覆盖四个代表性智能体领域,以研究依赖于时间跨度的退化模式。我们还提出了一种基于轨迹的LLM-as-a-Judge流程,用于可扩展且可复现的失败归因,并通过人工标注在轨迹上进行了验证,达到强一致性(互标注κ=0.61;人-判官κ=0.84)。我们的发现为系统的跨领域长时智能体失败分析提供了初步方法论步骤,并为构建更可靠的长时智能体提供了实用指导。我们发布了项目网站(HORIZON Leaderboard),欢迎社区贡献。
原贴
查看原文
原文
中文翻译
核心信息
大语言模型智能体在短中期任务上表现优异,但在需要长时间、相互依赖动作序列的长时任务上经常失败。尽管智能体系统进步迅速,但这些长时失败仍未得到良好表征,阻碍了跨领域的系统诊断和比较。为此,我们引入HORIZON,一个初步的跨领域诊断基准,用于系统构建任务并分析LLM智能体的长时失败行为。利用HORIZON,我们评估了多个模型系列(GPT-5变体和Claude模型)的先进智能体,收集了3100多条轨迹,覆盖四个代表性智能体领域,以研究依赖于时间跨度的退化模式。我们还提出了一种基于轨迹的LLM-as-a-Judge流程,用于可扩展且可复现的失败归因,并通过人工标注在轨迹上进行了验证,达到强一致性(互标注κ=0.61;人-判官κ=0.84)。我们的发现为系统的跨领域长时智能体失败分析提供了初步方法论步骤,并为构建更可靠的长时智能体提供了实用指导。我们发布了项目网站(HORIZON Leaderboard),欢迎社区贡献。
- LLM智能体在长时任务中系统性失败
- 提出HORIZON跨领域诊断基准
- 收集3100+轨迹分析退化模式
- LLM-as-a-Judge自动化归因有效
- 为构建可靠长时智能体提供指导
成为会员查看完整内容
你已经看到了这篇内容的前置整理,剩余深度部分仅对会员开放。