AI觉醒星球
Awakening is here
Knowledge File / AI技能杠杆
2026-04-15 0 浏览 会员

论文速读:The Long-Horizon Task Mirage? Diagnosing Where and Why,提升开发者接入体验

大语言模型智能体在短中期任务上表现优异,但在需要长时间、相互依赖动作序列的长时任务上经常失败。尽管智能体系统进步迅速,但这些长时失败仍未得到良好表征,阻碍了跨领域的系统诊断和比较。为此,我们引入HORIZON,一个初步的跨领域诊断基准,用于系统构建任务并分析LLM智能体的长时失败行为。利用HORIZON,我们评估了多个模型系列(GPT-5变体和Claude模型)的先进智能体,收集了3100多条轨迹,覆盖四个代表性智能体领域,以研究依赖于时间跨度的退化模式。我们还提出了一种基于轨迹的LLM-as-a-Judge流程,用于可扩展且可复现的失败归因,并通过人工标注在轨迹上进行了验证,达到强一致性(互标注κ=0.61;人-判官κ=0.84)。我们的发现为系统的跨领域长时智能体失败分析提供了初步方法论步骤,并为构建更可靠的长时智能体提供了实用指导。我们发布了项目网站(HORIZON Leaderboard),欢迎社区贡献。

SOURCE / AI技能杠杆 MIN / 4 ACCESS / 会员 POST / 2026-04-15 22:39:50

原贴

查看原文
作者:arXiv cs.AI 来源站点:arxiv.org 原贴时间:
论文速读:The Long-Horizon Task Mirage? Diagnosing Where and Why,提升开发者接入体验

原文

arXiv:2604.11978v1 Announce Type: new Abstract: Large language model (LLM) agents perform strongly on short- and mid-horizon tasks, but often break down on long-horizon tasks that require extended, interdependent action sequences. Despite rapid progress in agentic systems, these long-horizon failures remain poorly characterized, hindering principled diagnosis and comparison across domains. To address this gap, we introduce HORIZON, an initial cross-domain diagnostic benchmark for systematically constructing tasks and analyzing long-horizon failure behaviors in LLM-based agents. Using HORIZON, we evaluate state-of-the-art (SOTA) agents from multiple model families (GPT-5 variants and Claude models), collecting 3100+ trajectories across four representative agentic domains to study horizon-dependent degradation patterns. We further propose a trajectory-grounded LLM-as-a-Judge pipeline for scalable and reproducible failure attribution, and validate it with human annotation on trajectories, achieving strong agreement (inter-annotator \kappa=0.61; human-judge \kappa=0.84). Our findings offer an initial methodological step toward systematic, cross-domain analysis of long-horizon agent failures and offer practical guidance for building more reliable long-horizon agents. We release our project website at \href{https://xwang2775.github.io/horizon-leaderboard/}{HORIZON Leaderboard} and welcome contributions from the community.

中文翻译

大语言模型智能体在短中期任务上表现优异,但在需要长时间、相互依赖动作序列的长时任务上经常失败。尽管智能体系统进步迅速,但这些长时失败仍未得到良好表征,阻碍了跨领域的系统诊断和比较。为此,我们引入HORIZON,一个初步的跨领域诊断基准,用于系统构建任务并分析LLM智能体的长时失败行为。利用HORIZON,我们评估了多个模型系列(GPT-5变体和Claude模型)的先进智能体,收集了3100多条轨迹,覆盖四个代表性智能体领域,以研究依赖于时间跨度的退化模式。我们还提出了一种基于轨迹的LLM-as-a-Judge流程,用于可扩展且可复现的失败归因,并通过人工标注在轨迹上进行了验证,达到强一致性(互标注κ=0.61;人-判官κ=0.84)。我们的发现为系统的跨领域长时智能体失败分析提供了初步方法论步骤,并为构建更可靠的长时智能体提供了实用指导。

核心信息

大语言模型智能体在短中期任务上表现优异,但在需要长时间、相互依赖动作序列的长时任务上经常失败。尽管智能体系统进步迅速,但这些长时失败仍未得到良好表征,阻碍了跨领域的系统诊断和比较。为此,我们引入HORIZON,一个初步的跨领域诊断基准,用于系统构建任务并分析LLM智能体的长时失败行为。利用HORIZON,我们评估了多个模型系列(GPT-5变体和Claude模型)的先进智能体,收集了3100多条轨迹,覆盖四个代表性智能体领域,以研究依赖于时间跨度的退化模式。我们还提出了一种基于轨迹的LLM-as-a-Judge流程,用于可扩展且可复现的失败归因,并通过人工标注在轨迹上进行了验证,达到强一致性(互标注κ=0.61;人-判官κ=0.84)。我们的发现为系统的跨领域长时智能体失败分析提供了初步方法论步骤,并为构建更可靠的长时智能体提供了实用指导。我们发布了项目网站(HORIZON Leaderboard),欢迎社区贡献。

  • LLM智能体在长时任务中系统性失败
  • 提出HORIZON跨领域诊断基准
  • 收集3100+轨迹分析退化模式
  • LLM-as-a-Judge自动化归因有效
  • 为构建可靠长时智能体提供指导
试看内容

成为会员查看完整内容

你已经看到了这篇内容的前置整理,剩余深度部分仅对会员开放。

详细解读 信息差价值 参考来源
成为会员查看完整内容
上一篇 趋势解读:The next evolution of the Agents SDK,提升开发者接入体验 下一篇 论文速读:A longitudinal health agent framework,解读最新研究结论