趋势解读:AI models often give the right answers but,聚焦形式化数学证明能力
北京大学和上海人工智能实验室推出CiteVQA基准,测试AI模型在文档问答中的归因准确性,发现顶尖模型仅得分76,开源模型普遍低于25,暴露归因幻觉问题。
原贴
查看原文原文
中文翻译
核心信息
北京大学和上海人工智能实验室推出CiteVQA基准,测试AI模型在文档问答中的归因准确性,发现顶尖模型仅得分76,开源模型普遍低于25,暴露归因幻觉问题。
- CiteVQA揭示AI模型答案正确但归因错误的问题
- 顶尖模型归因准确率仅76分,开源模型低于25分
- 归因能力直接影响答案质量,尤其在法律、医疗等要求可追溯的领域
- 模型在复杂布局和跨文档任务上表现更差
详细解读
这是什么信号
北京大学和上海人工智能实验室联合发布的CiteVQA基准测试,首次系统性地量化了AI模型在文档问答中的“归因幻觉”问题——即模型能给出正确答案,却无法指向正确来源。这一信号表明,当前主流大语言模型在可解释性和可信赖度上存在根本性短板,尤其在高风险领域如法律、医疗和金融审计中,仅凭答案正确远不足以支撑实际应用。
为什么重要
过去业界聚焦于模型的最终答案准确率,但忽略了一个关键问题:AI如何获得答案?CiteVQA通过严格归因评分揭示了真相:即使表现最好的Gemini-3.1-Pro-Preview也只得到76分,而开源模型普遍低于25,且小模型在受监管场景中“风险极大”。这意味着,依赖AI进行文档分析的企业若不验证来源,可能被误导。同时,研究证明准确归因能直接提升答案质量——上下文工程比模型参数更重要。
对谁有价值
对法律、医疗、金融等强监管行业的从业者,该基准提供了评估AI工具落地合规性的标尺;对AI产品经理和开发者,它指明了优化方向:应优先提升文档检索和引用能力,而非盲目追求答案准确率;对内容生产者(如OPC),这意味着生成式AI在事实核查、资料整理等场景中存在系统性风险,人工复核仍是必要环节。
可以怎么行动
如果你在评估企业内部AI工具,建议使用类似CiteVQA的归因测试验证模型可靠性,最低门槛设为70分以上;若使用开源模型,需配合“检索增强生成(RAG)”管道缩小搜索范围,消融实验显示此举可提升13分以上。对于内容团队,可建立“答案-来源”双核查机制,并将上下文优化作为工作流关键步骤。
风险或限制
当前基准仅覆盖PDF格式,实际业务中还有网页、图像、数据库等多模态来源。此外,自动化标注流程可能引入偏差,且严格归因指标可能低估模型在模糊推理任务中的价值。过度追求引用精确性也可能牺牲效率,需根据业务场景权衡。
信息差价值
信息差价值:多数人只关注AI的答案正确率,忽视归因可靠性。CiteVQA的评测结果构成信息差:它能帮你提前识别哪些AI工具在真实业务中存在“看似正确实则误导”的风险,避免在合规审计或内容生产中踩坑。例如,GPT-5.4原始答案分87.1但归因分仅59,这意味着它给出的答案可能是“猜”出来的,在法律合同中引用这样的输出后果严重。
业务启发:对于依赖文档处理的业务(如尽调、合同审查、学术综述),应该将“归因准确性”纳入AI选型核心指标,而非只看总分。此外,研究表明缩小搜索空间(如RAG)能显著提升归因分,这提示企业在部署AI时,优先投资上下文工程而非更大模型,可能是更划算的策略。
可沉淀动作:第一,建立内部归因测试集,模拟业务文档场景对候选模型进行背书检查;第二,设计“答案+来源”双框输出模板,要求AI每次回答必须附带可点击的段落引用;第三,将归因质量纳入内容审核SOP,对高分模型开放自动化流程,低分模型仅用于辅助初稿。