{"version":"1.0","generated_at":"2026-10-05T02:19:39.029582","id":1174,"slug":"frontiercode-ai-13-4","title":"FrontierCode 基准测试：AI 编程评估新标准--维护者审核通过率最高仅 13.4%","summary":"Cognition发布FrontierCode基准测试，由顶级维护者手工制作150个任务，依据3000多条规则评估AI编程能力，结果显示最强模型Claude Opus 4.8在最高难度档通过率仅13.4%，GPT-5.5为6.3%，其余模型1%-5%。","abstract":"FrontierCode 基准测试：AI 编程评估新标准--维护者审核通过率最高仅 13.4% Cognition发布FrontierCode基准测试，由顶级维护者手工制作150个任务，依据3000多条规则评估AI编程能力，结果显示最强模型Claude Opus 4.8在最高难度档通过率仅13.4%，GPT-5.5为6.3%，其余模型1%-5%。 FrontierCode由20多位顶级维护者手工制作150个任务 超半数SWE-Bench通过代码被判定为不可维护 Claude Opus 4.8在最高难度通过率仅13.4% 最强模型近九成代码无法通过维护者审核 重新定义AI编程评估标准 Cognition 发布 FrontierCode 基准测试，重新定义 AI 编程评估：由 20 多位顶级开源维护者手工制作 150 个任务（每个耗时 40+ 小时），依据 3000 多条规则判断维护者是否愿意合并代码。该基准指出 SWE-Bench 等超半数通过测试的代码实为不可维护的垃圾。结果中 Claude Opus 4.8 在最高难度档获 13.4%，GPT-5.5 为 6.3%，其余模型 1%-5%。这意味着即便最强模型，近九成代码仍无法通过有经验维护者审核。 这是什么信号 FrontierCode基准测试是AI编程评估领域的一次重要革新，由Cognition发布，其核心特点是引入顶级开源维护者的人工审核标准，而非传统的自动化测试。该测试指向当前主流基准（如SWE-Bench）的严重缺陷：超半数通过测试的代码实际上不可维护，表明现有评估体系可能高估了AI编程能力。 为什么重要 过去，AI…","access_level":"public","access_label":"公开","access_mode":"full","is_preview":false,"canonical_url":"https://opc.beizhux.com/content/1174/frontiercode-ai-13-4","html_url":"https://opc.beizhux.com/content/1174/frontiercode-ai-13-4","json_url":"https://opc.beizhux.com/content/1174/frontiercode-ai-13-4.json","published_at":"2026-06-09T08:44:56","updated_at":"2026-10-05T01:32:55","category":{"slug":"hotspots","name":"全球热点解读"},"source":{"site":"x.com","author":"X：阿易 AI Notes (@AYi_AInotes)","url":"https://x.com/AYi_AInotes/status/2064146694774595646"},"tags":["AI","AIHOT 精选","AI编程","Cognition","FrontierCode","代码质量","基准测试","开源维护"],"topics":[{"slug":"agent-workflow","name":"Agent工作流","url":"https://opc.beizhux.com/topics/agent-workflow","reason":"这篇内容命中「AI编程」等主题信号。"},{"slug":"ai-tools","name":"AI工具","url":"https://opc.beizhux.com/topics/ai-tools","reason":"这篇内容命中「模型、Claude」等主题信号。"},{"slug":"ai-daily","name":"AI日报","url":"https://opc.beizhux.com/topics/ai-daily","reason":"这篇内容命中「热点解读」等主题信号。"}],"keywords":["全球热点解读","Agent工作流","AI工具","AI日报","每日AI日报","AI信号","热点解读","BuilderPulse","工具","自动化","模型","Cursor"],"questions":[{"question":"FrontierCode 基准测试：AI 编程评估新标准--维护者审核通过率最高仅 13.4%主要讲什么？","answer":"Cognition发布FrontierCode基准测试，由顶级维护者手工制作150个任务，依据3000多条规则评估AI编程能力，结果显示最强模型Claude Opus 4.8在最高难度档通过率仅13.4%，GPT-5.5为6.3%，其余模型1%-5%。"},{"question":"这篇文章最值得关注的要点是什么？","answer":"Cognition发布FrontierCode基准测试，由顶级维护者手工制作150个任务，依据3000多条规则评估AI编程能力，结果显示最强模型Claude Opus 4.8在最高难度档通过率仅13.4%，GPT-5.5为6.3%，其余模…；FrontierCode由20多位顶级维护者手工制作150个任务；超半数SWE-Bench通过代码被判定为不可维护；Claude Opus 4.8在最高难度通过率仅13.4%"},{"question":"这篇文章和哪些AI专题相关？","answer":"它适合放在Agent工作流、AI工具、AI日报专题里阅读。 关联原因：这篇内容命中「AI编程」等主题信号。；这篇内容命中「模型、Claude」等主题信号。；这篇内容命中「热点解读」等主题信号。"},{"question":"阅读这篇文章建议先理解哪些关键词？","answer":"建议先理解AI日报、每日AI日报、AI信号、热点解读、BuilderPulse这些关键词，再结合正文判断工具、机会或风险是否值得进入自己的工作流。"}],"terms":[{"slug":"ai-daily-term","name":"AI日报","definition":"在AI觉醒星球里，「AI日报」属于「AI日报」方向。持续整理每日AI日报、模型更新、工具变化和行业信号，帮你快速判断哪些信息值得收藏、验证和行动。 每天先看趋势，再决定今天该试什么。","topic_slug":"ai-daily","topic_name":"AI日报","topic_title":"AI日报：每日AI信号、工具动态与行动判断","topic_url":"https://opc.beizhux.com/topics/ai-daily","topic_path":"/topics/ai-daily","url":"https://opc.beizhux.com/glossary/ai-daily-term","path":"/glossary/ai-daily-term","json_url":"https://opc.beizhux.com/glossary/ai-daily-term.json"},{"slug":"daily-ai-briefing","name":"每日AI日报","definition":"在AI觉醒星球里，「每日AI日报」属于「AI日报」方向。持续整理每日AI日报、模型更新、工具变化和行业信号，帮你快速判断哪些信息值得收藏、验证和行动。 每天先看趋势，再决定今天该试什么。","topic_slug":"ai-daily","topic_name":"AI日报","topic_title":"AI日报：每日AI信号、工具动态与行动判断","topic_url":"https://opc.beizhux.com/topics/ai-daily","topic_path":"/topics/ai-daily","url":"https://opc.beizhux.com/glossary/daily-ai-briefing","path":"/glossary/daily-ai-briefing","json_url":"https://opc.beizhux.com/glossary/daily-ai-briefing.json"},{"slug":"ai-signal","name":"AI信号","definition":"在AI觉醒星球里，「AI信号」属于「AI日报」方向。持续整理每日AI日报、模型更新、工具变化和行业信号，帮你快速判断哪些信息值得收藏、验证和行动。 每天先看趋势，再决定今天该试什么。","topic_slug":"ai-daily","topic_name":"AI日报","topic_title":"AI日报：每日AI信号、工具动态与行动判断","topic_url":"https://opc.beizhux.com/topics/ai-daily","topic_path":"/topics/ai-daily","url":"https://opc.beizhux.com/glossary/ai-signal","path":"/glossary/ai-signal","json_url":"https://opc.beizhux.com/glossary/ai-signal.json"},{"slug":"ai-news-analysis","name":"热点解读","definition":"在AI觉醒星球里，「热点解读」属于「AI日报」方向。持续整理每日AI日报、模型更新、工具变化和行业信号，帮你快速判断哪些信息值得收藏、验证和行动。 每天先看趋势，再决定今天该试什么。","topic_slug":"ai-daily","topic_name":"AI日报","topic_title":"AI日报：每日AI信号、工具动态与行动判断","topic_url":"https://opc.beizhux.com/topics/ai-daily","topic_path":"/topics/ai-daily","url":"https://opc.beizhux.com/glossary/ai-news-analysis","path":"/glossary/ai-news-analysis","json_url":"https://opc.beizhux.com/glossary/ai-news-analysis.json"},{"slug":"builderpulse","name":"BuilderPulse","definition":"在AI觉醒星球里，「BuilderPulse」属于「AI日报」方向。持续整理每日AI日报、模型更新、工具变化和行业信号，帮你快速判断哪些信息值得收藏、验证和行动。 每天先看趋势，再决定今天该试什么。","topic_slug":"ai-daily","topic_name":"AI日报","topic_title":"AI日报：每日AI信号、工具动态与行动判断","topic_url":"https://opc.beizhux.com/topics/ai-daily","topic_path":"/topics/ai-daily","url":"https://opc.beizhux.com/glossary/builderpulse","path":"/glossary/builderpulse","json_url":"https://opc.beizhux.com/glossary/builderpulse.json"},{"slug":"ai-tools-term","name":"AI工具","definition":"在AI觉醒星球里，「AI工具」属于「AI工具」方向。围绕AI工具、模型能力、自动化流程和真实使用场景做整理，优先关注能提升效率、降低成本和创造新交付的工具。 不只看工具热度，更看它能不能进入真实流程。","topic_slug":"ai-tools","topic_name":"AI工具","topic_title":"AI工具：模型、插件、自动化与实战场景","topic_url":"https://opc.beizhux.com/topics/ai-tools","topic_path":"/topics/ai-tools","url":"https://opc.beizhux.com/glossary/ai-tools-term","path":"/glossary/ai-tools-term","json_url":"https://opc.beizhux.com/glossary/ai-tools-term.json"},{"slug":"tools","name":"工具","definition":"在AI觉醒星球里，「工具」属于「AI工具」方向。围绕AI工具、模型能力、自动化流程和真实使用场景做整理，优先关注能提升效率、降低成本和创造新交付的工具。 不只看工具热度，更看它能不能进入真实流程。","topic_slug":"ai-tools","topic_name":"AI工具","topic_title":"AI工具：模型、插件、自动化与实战场景","topic_url":"https://opc.beizhux.com/topics/ai-tools","topic_path":"/topics/ai-tools","url":"https://opc.beizhux.com/glossary/tools","path":"/glossary/tools","json_url":"https://opc.beizhux.com/glossary/tools.json"},{"slug":"automation","name":"自动化","definition":"在AI觉醒星球里，「自动化」属于「AI工具」方向。围绕AI工具、模型能力、自动化流程和真实使用场景做整理，优先关注能提升效率、降低成本和创造新交付的工具。 不只看工具热度，更看它能不能进入真实流程。","topic_slug":"ai-tools","topic_name":"AI工具","topic_title":"AI工具：模型、插件、自动化与实战场景","topic_url":"https://opc.beizhux.com/topics/ai-tools","topic_path":"/topics/ai-tools","url":"https://opc.beizhux.com/glossary/automation","path":"/glossary/automation","json_url":"https://opc.beizhux.com/glossary/automation.json"}],"preview_hidden_sections":[],"related_items":[{"id":3215,"title":"LMSYS 发布开源聊天模型 Vicuna-13B，用 ShareGPT 对话微调 LLaMA，训练成本约 $300","url":"https://opc.beizhux.com/content/3215/lmsys-vicuna-13b-sharegpt-llama-300","summary":"LMSYS 发布 Vicuna-13B，用约 70K ShareGPT 对话微调 LLaMA，训练成本约 $300，代码、权重和 demo 以非商业许可公开。GPT-4 初步评审称其达到 ChatGPT/Bard 90% 以上质量，45% 问题不逊于 ChatGPT，但评测尚非严谨方法。","access_level":"public"},{"id":3222,"title":"Mo Gawdat 谈 AI 与人类未来","url":"https://opc.beizhux.com/content/3222/mo-gawdat-ai","summary":"前 Google 高管 Mo Gawdat 认为，AI 不是人类的终结，反而可能是救赎；人类的问题不是太聪明，而是智能有限，有限智能已足以制造大量麻烦。","access_level":"public"},{"id":3231,"title":"【必读】每日AI日报 2026-10-04","url":"https://opc.beizhux.com/content/3231/aihot-daily-2026-10-04","summary":"AIHOT 每日 AI 日报：模型发布/更新： - LMSYS 发布开源聊天模型 Vicuna-13B，用 ShareGPT 对话微调 LLaMA，训练成本约 $300：LMSYS 团队发布 Vicuna-13B，通过约 70K ShareGPT 用户共享对话微调 LLaMA，训练成本约 $300，代码、权重和在线…","access_level":"public"}],"usage_policy":{"summarizable":true,"preferred_url":"https://opc.beizhux.com/content/1174/frontiercode-ai-13-4","private_fields_excluded":true}}