DiScoFormer:一个用于密度和分数、跨分布的Transformer
介绍DiScoFormer,一种无需重新训练即可同时估计数据分布密度和分数的Transformer模型,通过注意力机制改进传统方法,并能适应分布外输入。
原贴
查看原文原文
中文翻译
机器学习和科学中的许多问题都归结为同一项任务:你有一组数据点,想要恢复它们所来自的分布——哪些值常见,哪些值罕见。确定该分布意味着估计两个量:分布的密度,以及在维度增加时更有用的分数。密度是直方图的平滑版本——在点聚集的地方高,在点稀少的地方低。分数——对数密度的梯度——指向密度上升最快的方向:沿着分数移动一个点,它会朝向更可能出现的区域。基于扩散的生成模型(如Stable Diffusion和DALL-E等AI图像生成器背后的技术)从随机噪声开始,反复跟随分数,将噪声转化为逼真的图像。同样的分数驱动贝叶斯采样和用于模拟等离子体等系统的粒子模拟。从有限样本中提取密度和分数具有挑战性,当今的工具迫使在泛化性和准确性之间权衡。一种经典方法,核密度估计(KDE),根据周围数据点计算任何位置的密度:数据点越近越多,密度越高。它无需训练,适用于任何分布,但其准确性随维度增加而急剧下降。另一种方法,神经分数匹配模型,训练后即使在维度较高时也能保持准确性,但每个模型都需要学习分布,并且必须从头开始重新训练才能应用于另一个分布。我们提出了一种新解决方案,称为DiScoFormer(密度和分数变换器)——一个模型,给定一组数据点,即可在一次前向传递中估计分布的密度和分数,无需重新训练。DiScoFormer使用堆叠的Transformer块层将整个样本映射到其背后的分布的密度和分数。该模型利用交叉注意力,可以在任何点评估密度和分数——而不仅仅是在有数据的点。分数和密度存在数学关系:分数是密度对数的梯度。我们通过共享骨干网络和两个输出头(一个用于密度,一个用于分数)来利用这一点。这种耦合不仅节省了参数。分数头必须在每个查询处匹配对数密度头的梯度,因此两者之间的任何间隙都是无标签的一致性损失。我们在推理时使用这一点——保持上下文固定,对一致性损失进行几步梯度更新,DiScoFormer就会即时适应分布外的输入,无需真实的密度或分数。Transformer架构适合此任务有一个数学原因。核密度估计只有一个带宽——每个点的影响范围,预先固定并统一应用。注意力是其严格泛化:我们分析表明,单个注意力头的权重几乎就是数据上的高斯核,因此一个交叉注意力块已经可以重现KDE的密度和分数。从那里开始,模型更进一步,同时学习多个这样的尺度并适应数据。DiScoFormer并没有将经典方法丢弃为黑箱,而是将KDE作为特例包含在内并加以改进。我们使用什么数据训练DiScoFormer?我们依赖高斯混合模型(GMM),主要有两个原因。首先,GMM是通用密度逼近器——只要有足够多的分量,它们就能以任意小的误差匹配任何平滑分布。其次,GMM具有封闭形式的密度和分数,因此我们总是有精确的目标进行监督。我们利用这两个特性,为每个批次抽取一个新的GMM,为模型提供几乎无限的目标分布示例,并针对给定GMM的精确密度和分数对每个进行监督。总体而言,DiScoFormer优于
核心信息
介绍DiScoFormer,一种无需重新训练即可同时估计数据分布密度和分数的Transformer模型,通过注意力机制改进传统方法,并能适应分布外输入。
- 介绍DiScoFormer,一种无需重新训练即可同时估计数据分布密度和分数的Transformer模型,通过注意力机制改进传统方法,并能适应分布外输入。
- 原贴提到:Many problems in machine learning and the sciences come down to the same
- 来源:huggingface.co
成为会员查看完整内容
你已经看到了这篇内容的前置整理,剩余深度部分仅对会员开放。