{"version":"1.0","generated_at":"2026-09-27T14:55:15.799381","id":2771,"slug":"dude-a-dual-detection-multi-agent-system-for-paper-code-discrepancy-detection","title":"Dude：用于论文-代码差异检测的双重检测多智能体系统","summary":"Dude 是首个面向论文-代码差异检测的双重检测多智能体系统，针对单智能体 LLM 上下文有限、检测片面导致的低召回，以及论文与代码粒度不对称引发的误报问题，提出粒度对齐协商与两阶段显著性过滤机制，在真实数据集上将召回率和精确率最高提升 22.8%，F1 最高提升 18.7%。","abstract":"Dude：用于论文-代码差异检测的双重检测多智能体系统 Dude 是首个面向论文-代码差异检测的双重检测多智能体系统，针对单智能体 LLM 上下文有限、检测片面导致的低召回，以及论文与代码粒度不对称引发的误报问题，提出粒度对齐协商与两阶段显著性过滤机制，在真实数据集上将召回率和精确率最高提升 22.8%，F1 最高提升 18.7%。 Dude 是首个面向论文-代码差异检测的双重检测多智能体系统，针对单智能体 LLM 上下文有限、检测片面导致的低召回，以及论文与代码粒度不对称引发的误报问题，提出粒度对齐协商与两阶段显著性过滤机制，在真实数据集上将召回率和精确率最高提升 22.8%，F1 最高提升 18.7%。 原贴提到：arXiv:2609.03416v1 Announce Type: new Abstract: LLM-empowered paper-code 来源：arxiv.org 由 LLM 赋能的论文-代码差异检测已受到越来越多的关注，因为研究投稿的规模超出了人工评审的能力。然而，现有单智能体 LLM 范式有限的上下文容量和单方面的差异检测，导致在检测差异时召回性能不佳。在本文中，我们提出 Dude，首个用于论文-代码差异检测的双重检测多智能体系统。我们发现，论文语言和代码语言的粒度不对称，在多智能体系统设计中引入了过度解释和过度报告的挑战，导致假阳性增加。为了解决这个问题，我们在 Dude 中提出了粒度对齐协商和两阶段显著性过滤机制，有效防止智能体错误报告差异。在真实世界论文-代码差异数据集上的实验结果表明，与基线方法相比，Dude 的召回率和精确率显著提升，最高提…","access_level":"member","access_label":"免费阅读","access_mode":"full","is_preview":false,"canonical_url":"https://opc.beizhux.com/content/2771/dude-a-dual-detection-multi-agent-system-for-paper-code-discrepancy-detection","html_url":"https://opc.beizhux.com/content/2771/dude-a-dual-detection-multi-agent-system-for-paper-code-discrepancy-detection","json_url":"https://opc.beizhux.com/content/2771/dude-a-dual-detection-multi-agent-system-for-paper-code-discrepancy-detection.json","published_at":"2026-09-04T12:00:00","updated_at":"2026-09-27T14:07:14","category":{"slug":"ai-skills","name":"AI技能杠杆"},"source":{"site":"arxiv.org","author":"Weijie Liu, Running Zhao, Wenhao Yuan, Jinfeng Xu, Zhanfeng Xu, Xiaoxi Zhang, Edith Cheuk-Han Ngai","url":"https://arxiv.org/abs/2609.03416"},"tags":["AI","AI4Science","AI科研","arXiv","arXiv cs.AI","LLM","LLM评测","代码一致性检测","可复现性","多智能体","多智能体系统","大模型应用"],"topics":[{"slug":"agent-workflow","name":"Agent工作流","url":"https://opc.beizhux.com/topics/agent-workflow","reason":"这篇内容命中「Agent、智能体、工作流」等主题信号。"},{"slug":"ai-tools","name":"AI工具","url":"https://opc.beizhux.com/topics/ai-tools","reason":"这篇内容命中「自动化、模型」等主题信号。"},{"slug":"ai-super-individual","name":"AI超级个体","url":"https://opc.beizhux.com/topics/ai-super-individual","reason":"这篇内容命中「技能」等主题信号。"}],"keywords":["AI技能杠杆","Agent工作流","AI工具","AI超级个体","工具","自动化","模型","Cursor","Claude","Agent","智能体","工作流"],"questions":[{"question":"Dude：用于论文-代码差异检测的双重检测多智能体系统主要讲什么？","answer":"Dude 是首个面向论文-代码差异检测的双重检测多智能体系统，针对单智能体 LLM 上下文有限、检测片面导致的低召回，以及论文与代码粒度不对称引发的误报问题，提出粒度对齐协商与两阶段显著性过滤机制，在真实数据集上将召回率和精确率最高提升 22.8%，F1 最高提升 18.7%。"},{"question":"这篇文章最值得关注的要点是什么？","answer":"Dude 是首个面向论文-代码差异检测的双重检测多智能体系统，针对单智能体 LLM 上下文有限、检测片面导致的低召回，以及论文与代码粒度不对称引发的误报问题，提出粒度对齐协商与两阶段显著性过滤机制，在真实数据集上将召回率和精确率最高提升…；原贴提到：arXiv:2609.03416v1 Announce Type: new Abstract: LLM-empowered paper-code；来源：arxiv.org"},{"question":"这篇文章和哪些AI专题相关？","answer":"它适合放在Agent工作流、AI工具、AI超级个体专题里阅读。 关联原因：这篇内容命中「Agent、智能体、工作流」等主题信号。；这篇内容命中「自动化、模型」等主题信号。；这篇内容命中「技能」等主题信号。"},{"question":"阅读这篇文章建议先理解哪些关键词？","answer":"建议先理解AI工具、工具、自动化、模型、Cursor这些关键词，再结合正文判断工具、机会或风险是否值得进入自己的工作流。"}],"terms":[{"slug":"ai-tools-term","name":"AI工具","definition":"在AI觉醒星球里，「AI工具」属于「AI工具」方向。围绕AI工具、模型能力、自动化流程和真实使用场景做整理，优先关注能提升效率、降低成本和创造新交付的工具。 不只看工具热度，更看它能不能进入真实流程。","topic_slug":"ai-tools","topic_name":"AI工具","topic_title":"AI工具：模型、插件、自动化与实战场景","topic_url":"https://opc.beizhux.com/topics/ai-tools","topic_path":"/topics/ai-tools","url":"https://opc.beizhux.com/glossary/ai-tools-term","path":"/glossary/ai-tools-term","json_url":"https://opc.beizhux.com/glossary/ai-tools-term.json"},{"slug":"tools","name":"工具","definition":"在AI觉醒星球里，「工具」属于「AI工具」方向。围绕AI工具、模型能力、自动化流程和真实使用场景做整理，优先关注能提升效率、降低成本和创造新交付的工具。 不只看工具热度，更看它能不能进入真实流程。","topic_slug":"ai-tools","topic_name":"AI工具","topic_title":"AI工具：模型、插件、自动化与实战场景","topic_url":"https://opc.beizhux.com/topics/ai-tools","topic_path":"/topics/ai-tools","url":"https://opc.beizhux.com/glossary/tools","path":"/glossary/tools","json_url":"https://opc.beizhux.com/glossary/tools.json"},{"slug":"automation","name":"自动化","definition":"在AI觉醒星球里，「自动化」属于「AI工具」方向。围绕AI工具、模型能力、自动化流程和真实使用场景做整理，优先关注能提升效率、降低成本和创造新交付的工具。 不只看工具热度，更看它能不能进入真实流程。","topic_slug":"ai-tools","topic_name":"AI工具","topic_title":"AI工具：模型、插件、自动化与实战场景","topic_url":"https://opc.beizhux.com/topics/ai-tools","topic_path":"/topics/ai-tools","url":"https://opc.beizhux.com/glossary/automation","path":"/glossary/automation","json_url":"https://opc.beizhux.com/glossary/automation.json"},{"slug":"ai-model","name":"模型","definition":"在AI觉醒星球里，「模型」属于「AI工具」方向。围绕AI工具、模型能力、自动化流程和真实使用场景做整理，优先关注能提升效率、降低成本和创造新交付的工具。 不只看工具热度，更看它能不能进入真实流程。","topic_slug":"ai-tools","topic_name":"AI工具","topic_title":"AI工具：模型、插件、自动化与实战场景","topic_url":"https://opc.beizhux.com/topics/ai-tools","topic_path":"/topics/ai-tools","url":"https://opc.beizhux.com/glossary/ai-model","path":"/glossary/ai-model","json_url":"https://opc.beizhux.com/glossary/ai-model.json"},{"slug":"cursor","name":"Cursor","definition":"在AI觉醒星球里，「Cursor」属于「AI工具」方向。围绕AI工具、模型能力、自动化流程和真实使用场景做整理，优先关注能提升效率、降低成本和创造新交付的工具。 不只看工具热度，更看它能不能进入真实流程。","topic_slug":"ai-tools","topic_name":"AI工具","topic_title":"AI工具：模型、插件、自动化与实战场景","topic_url":"https://opc.beizhux.com/topics/ai-tools","topic_path":"/topics/ai-tools","url":"https://opc.beizhux.com/glossary/cursor","path":"/glossary/cursor","json_url":"https://opc.beizhux.com/glossary/cursor.json"},{"slug":"claude","name":"Claude","definition":"在AI觉醒星球里，「Claude」属于「AI工具」方向。围绕AI工具、模型能力、自动化流程和真实使用场景做整理，优先关注能提升效率、降低成本和创造新交付的工具。 不只看工具热度，更看它能不能进入真实流程。","topic_slug":"ai-tools","topic_name":"AI工具","topic_title":"AI工具：模型、插件、自动化与实战场景","topic_url":"https://opc.beizhux.com/topics/ai-tools","topic_path":"/topics/ai-tools","url":"https://opc.beizhux.com/glossary/claude","path":"/glossary/claude","json_url":"https://opc.beizhux.com/glossary/claude.json"},{"slug":"agent","name":"Agent","definition":"在AI觉醒星球里，「Agent」属于「Agent工作流」方向。聚合Agent、AI编程、Claude Code、Cursor、工作流自动化等内容，帮助你把智能体能力落到真实任务链路。 把智能体当成任务系统，而不是聊天窗口。","topic_slug":"agent-workflow","topic_name":"Agent工作流","topic_title":"Agent工作流：智能体、AI编程与自动化协作","topic_url":"https://opc.beizhux.com/topics/agent-workflow","topic_path":"/topics/agent-workflow","url":"https://opc.beizhux.com/glossary/agent","path":"/glossary/agent","json_url":"https://opc.beizhux.com/glossary/agent.json"},{"slug":"ai-agent","name":"智能体","definition":"在AI觉醒星球里，「智能体」属于「Agent工作流」方向。聚合Agent、AI编程、Claude Code、Cursor、工作流自动化等内容，帮助你把智能体能力落到真实任务链路。 把智能体当成任务系统，而不是聊天窗口。","topic_slug":"agent-workflow","topic_name":"Agent工作流","topic_title":"Agent工作流：智能体、AI编程与自动化协作","topic_url":"https://opc.beizhux.com/topics/agent-workflow","topic_path":"/topics/agent-workflow","url":"https://opc.beizhux.com/glossary/ai-agent","path":"/glossary/ai-agent","json_url":"https://opc.beizhux.com/glossary/ai-agent.json"}],"preview_hidden_sections":[],"related_items":[{"id":3094,"title":"研究发现：有 AI 可用时，人们几乎完全不愿说“我不知道”","url":"https://opc.beizhux.com/content/3094/ai-access-makes-people-almost-entirely-unwilling-to-say-i-don-t-know-study-finds","summary":"一项包含 5 个实验、3,132 名参与者的研究显示，只要能向 AI 求助，人们几乎不再说“我不知道”。在研究者刻意挑选的、模型几乎总是答错的电影细节题上，参与者的信心升到约 2.5 倍（75.9 对 29.6，满分 100），正确率却从 27.6% 降到 10.0%；合并所有研究，有 AI 时正确率 9.2%，无…","access_level":"member"},{"id":3081,"title":"Arena：GPT-6 Sol（Max）以 +7.7% 净改进重塑 Agent Arena Pareto 前沿","url":"https://opc.beizhux.com/content/3081/arena-gpt-6-sol-max-7-7-agent-arena-pareto","summary":"Arena 宣布 OpenAI 的 GPT-6 Sol（Max）进入 Agent Arena，基于 4K+ 真实智能体会话取得 +7.7% 净改进，排名第 6，中位成本 $0.75/task。榜单同时给出得分与成本两个维度，读者可据此判断该模型在性价比坐标上的位置。","access_level":"member"},{"id":3105,"title":"趋势解读：Meta's Muse agent gives every user a full，解读最新 AI 进展","url":"https://opc.beizhux.com/content/3105/meta-s-muse-agent-gives-every-user-a-full-cloud-computer-running-ubuntu-linux","summary":"趋势解读：Meta's Muse agent gives every user a full，解读最新 AI 进展：这条内容属于AI 技能与工作流，核心焦点是解读最新 AI 进展，适合继续追踪它对内容生产、业务执行和工具工作流的直接影响。","access_level":"member"}],"usage_policy":{"summarizable":true,"preferred_url":"https://opc.beizhux.com/content/2771/dude-a-dual-detection-multi-agent-system-for-paper-code-discrepancy-detection","private_fields_excluded":true}}