AI觉醒星球
Awakening is here
Knowledge File / 全球热点解读
2026-04-14 4 浏览 公开

论文速读:From Scalars to Tensors,解读最新 AI 进展

该论文在Leyva-Vázquez等人工作的基础上,扩展了中智T/I/F评估到多个模型系列,发现'超真实'现象普遍存在,并指出标量T/I/F的局限,提出张量结构输出(标量+损失)能更好表示LLM认知能力。

SOURCE / 全球热点解读 MIN / 4 ACCESS / 公开 POST / 2026-04-14 12:55:10

原贴

查看原文
作者:arXiv cs.AI 来源站点:arxiv.org 原贴时间:

原文

arXiv:2604.09602v1 Announce Type: new Abstract: Leyva-V\'azquez and Smarandache (2025) demonstrated that neutrosophic T/I/F evaluation, where Truth, Indeterminacy, and Falsity are independent dimensions not constrained to sum to 1.0, which reveals "hyper-truth"' (T+I+F > 1.0) in 35% of complex epistemic cases evaluated by LLMs. We extend their work in two directions. First, we replicate and extend their experiment across five model families from five vendors (Anthropic, Meta, DeepSeek, Alibaba, Mistral), finding hyper-truth in 84% of unconstrained evaluations, which confirms the phenomenon is cross-vendor under our prompt protocol. Second, and more significantly, we identify a limitation of scalar T/I/F that their framework cannot address: models adopting an `"Absorption" position (T=0, I=1, F=0) produce identical scalar outputs for fundamentally different epistemic situations (paradox, ignorance, contingency), collapsing the very distinctions neutrosophic logic was designed to preserve. We demonstrate that extending the evaluation to include declared losses (structured descriptions of what the model cannot evaluate and why) substantially recovers these distinctions. Models producing identical scalars for paradox and ignorance produce nearly disjoint loss vocabularies (Jaccard similarity < 0.10 on loss description keywords), with domain-specific, severity-rated loss declarations that differentiate the nature of their uncertainty. This suggests that scalar T/I/F is a necessary but insufficient representation of epistemic state, and that tensor-structured output (scalars + losses) provides a more faithful model of LLM epistemic capabilities.

中文翻译

Leyva-V\'azquez 和 Smarandache (2025) 证明了中智 T/I/F 评估,其中真理、不确定性和虚假是独立维度,不限制总和为 1.0,这揭示了 35% 的复杂认知中的“超真理”(T+I+F > 1.0)由法学硕士评估的案例。我们将他们的工作扩展到两个方向。首先,我们在来自五个供应商(Anthropic、Meta、DeepSeek、Alibaba、Mistral)的五个模型系列中复制并扩展了他们的实验,在 84% 的无约束评估中发现了超真实性,这证实了该现象在我们的提示协议下是跨供应商的。其次,更重要的是,我们发现标量 T/I/F 的局限性是他们的框架无法解决的:采用“吸收”位置(T=0、I=1、F=0)的模型对于根本不同的认知情况(悖论、无知、偶然性)产生相同的标量输出,从而瓦解了中智逻辑旨在保留的区别。我们证明,将评估范围扩大到包括声明的损失(模型无法评估的内容及其原因的结构化描述)可以基本上恢复这些区别。为悖论和无知生成相同标量的模型会产生几乎不相交的损失词汇(损失描述关键字的 Jaccard 相似度 < 0.10),并具有特定于领域的、严重程度评级的损失声明,可以区分其不确定性的性质。这表明标量 T/I/F 是认知状态的必要但不充分的表示,并且张量结构输出(标量+损失)提供了 LLM 认知能力的更忠实的模型。

核心信息

该论文在Leyva-Vázquez等人工作的基础上,扩展了中智T/I/F评估到多个模型系列,发现'超真实'现象普遍存在,并指出标量T/I/F的局限,提出张量结构输出(标量+损失)能更好表示LLM认知能力。

  • 标量T/I/F评估中“吸收态”掩盖悖论、无知等不同认知状态
  • 引入损失声明可有效区分不同不确定性,Jaccard相似度<0.10
  • 跨5个供应商模型系列验证超真实现象普遍存在(84%)
  • 张量结构输出(标量+损失)更忠实反映LLM认知能力
  • 标量评估是必要但不充分的认知状态表示

详细解读

这是一个信号:LLM 评估方法正在从简单的标量(如真假/不确定)向更丰富的张量(标量+结构化损失描述)演进。传统标量评估(如 T/I/F 值)虽然能揭示“超真实”现象(T+I+F>1),但在区分不同认知状态(如悖论、无知、偶然性)时存在盲点——吸收态(T=0,I=1,F=0)会遮蔽本质差异。

为什么重要?因为当前主流评估依赖分类或评分,掩盖了模型不确定性的深层结构。该研究在 5 个供应商的 5 个模型系列上验证了跨模型的一致性(84% 超真实率),并提出了用“损失声明”来区分不同不确定性,Jaccard 相似度<0.10 表明区分度极高。这为更可靠、更细粒度的 LLM 行为评估奠定了基础。

对谁有价值?AI 研究者和评估工程师可直接采纳该框架;产品经理可改进人机协作的置信度标注;AI 安全团队能更精确识别模型在关键场景中的不确定性类型。行动建议:尝试在内部评估流程中加入“损失声明”维度,要求模型解释为何无法评估某问题;对比标量与张量输出的区分效果;关注该方向后续工具化进展。

风险与限制:该方法增加了输出结构的复杂度,可能带来计算成本;损失声明的质量依赖 prompt 设计,不同模板可能产生偏差;当前仅在学术摘要中提出,缺乏大规模实测,需警惕过拟合。此外,32% 的标量案例仍有混淆,张量并非万能。

信息差价值

信息差价值:多数人仅关注 LLM 的分数或分类,忽略了标量输出背后的认知盲区。该研究揭示了标量评估的“吸积效应”——不同认知状态被压缩成相同标量,而损失声明提供了结构化的“未解之谜”,这为更深入的模型理解打开了窗口。

业务启发:如果你的产品依赖 LLM 的置信度(如客服、决策支持),建议集成“损失声明”机制:让模型在不确定时输出具体原因(例如“缺乏某领域知识”“问题与已知事实矛盾”),而非单一数值。这能提升用户信任,并为改进提供可操作性。

可沉淀动作:1)设计一个 prompt 模板,要求 LLM 在回答时附加“损失声明”字段(无法评估的问题+原因);2)在内部测试中对比标量输出与张量输出的区分度;3)跟踪该研究方向(如 arxiv 相关论文),形成定期简报。

参考来源

上一篇 论文速读:CID-TKG,解读最新 AI 进展 下一篇 BuilderPulse 每日 AI 日报 · 2026-04-14