觉
AI觉醒星球
Awakening is here
Knowledge File / 全球热点解读
2026-10-04 2 浏览 公开

NASA 与 IBM 开源月球基础模型:把 17 年轨道器数据变成月球科学的地基

NASA 与 IBM Research 联合多家学术机构发布 NASA-IBM 月球基础模型,被称为最早的开源月球科学基础模型之一。模型用迄今最大的共配准多模态月球语料 SomBench 从头训练,汇聚 9 台仪器、4 次任务的 30 多个空间对齐数据层,主体来自月球勘测轨道器 17 年的观测。它在极区冰沉积预测上把误差最多降低 22%,粗尺度撞击坑检测比最强基线好近 19%,且只用了半数训练数据。

SOURCE / 全球热点解读 MIN / 9 ACCESS / 公开 POST / 2026-10-04 18:10:12

原贴

查看原文
作者:Jonathan Kemper 来源站点:the-decoder.com 原贴时间:

原文

The NASA-IBM Lunar Foundation Model makes decades of lunar observation data usable for machine learning. It's especially strong at predicting ice deposits at the poles and detecting craters. "NASA has spent decades building an extraordinary scientific record of the Moon, but collecting data is only part of the job," says Kevin Murphy, NASA's chief science data officer. The data also has to be easier for scientists to use, he adds. NASA and IBM Research, working with several academic institutions, have now released the NASA-IBM Lunar Foundation Model. The two organizations describe it as one of the first open-source foundation models for lunar science. Unlike task-specific algorithms, a foundation model is pretrained on large volumes of unlabeled data and can then be adapted to specific tasks with just a few labeled examples. The team sees this as the main benefit for lunar research, where observation data is plentiful but labels are scarce. Ad The team trained the model from scratch using SomBench, which they say is the largest co-registered multimodal lunar corpus to date. It contains nearly 2 million tile bundles across 11 modalities and two spatial scales. About 1 million high-resolution images come from the Narrow Angle Camera (NAC) at roughly 1 meter per pixel, while just under 964,000 multispectral images come from the Wide Angle Camera at 100 meters per pixel. Ad The bulk of the data comes from 17 years of observations by the Lunar Reconnaissance Orbiter (LRO). According to NASA, its data volume exceeds that of all other NASA planetary missions combined. Data from the GRAIL mission (gravity field), Lunar Prospector (hydrogen), and JAXA's Kaguya/SELENE probe (mineralogy) rounded out the collection. In total, the dataset brings together more than 30 spatially aligned data layers from nine instruments and four missions. To prevent leakage between training, validation, and test data, the corpus is split geographically by map zones rather than randomly distributing individual tiles. Ad The model is based on TerraMind , a multimodal Earth observation model, but the researchers trained it from scratch instead of fine-tuning it. For each tile, the model receives the imaging geometry as explicit context, including illumination angles, sun position, and tile extent. On the Moon, lighting geometry shapes how the surface looks far more than the surface's actual properties do. Rather than forcing the model to correct for this from raw pixels, the team simply feeds it that information. The model also learns from high-resolution and coarse imagery together in a single training run, capturing both fine details and large-scale context. A technique called FlexiViT lets the same trained model adapt to tasks with different image patch sizes without retraining. Ad The team tested the model on crater detection at 100-meter and 1-meter scales and on predicting polar ice deposits. It also had to segment Irregular Mare Patches (IMPs), young volcanic features that challenge established timelines of lunar cooling. Across all tasks, the pretrained model matched or beat both common baselines and an architecturally identical control model with random initialization, according to the technical report . Ad The biggest gains showed up in ice deposit prediction. Permanently shadowed polar regions stay cold enough to preserve water ice for billions of years and are considered a potential resource for water, oxygen, and rocket fuel. The model cut prediction error by up to 22 percent compared to the best baseline, SwinV2-B, according to IBM. For coarse-scale crater detection, the model beat SwinV2-B by nearly 19 percent, according to IBM. That number comes from training with only half the data, suggesting the model needs fewer labeled examples to perform well. Even the randomly initialized control model beat five of seven baselines on ice prediction without any lunar pretraining. According to the researchers, part of the advantage comes from how

中文翻译

NASA-IBM 月球基础模型让数十年的月球观测数据可用于机器学习。它尤其擅长预测两极的冰沉积和检测撞击坑。

“NASA 用数十年建立了一份非凡的月球科学记录,但收集数据只是工作的一部分,”NASA 首席科学数据官凯文·墨菲说。他补充说,数据还必须让科学家更容易使用。

NASA 与 IBM Research 联手多家学术机构,现已发布 NASA-IBM 月球基础模型。两家机构称其为最早的开源月球科学基础模型之一。与任务专用算法不同,基础模型在大规模无标注数据上预训练,之后只需少量标注样本即可适配特定任务。团队认为这正是月球研究的主要收益所在——观测数据充足,但标注稀缺。

团队使用 SomBench 从头训练该模型,他们称这是迄今最大的共配准多模态月球语料库。它包含跨 11 种模态、两个空间尺度的近 200 万个瓦片包。约 100 万张高分辨率图像来自窄角相机(NAC),约每像素 1 米;略低于 96.4 万张多光谱图像来自广角相机,每像素 100 米。

数据主体来自月球勘测轨道器(LRO)17 年的观测。据 NASA 称,其数据量超过所有其他 NASA 行星任务的总和。来自 GRAIL 任务(重力场)、月球勘探者号(氢)以及日本 JAXA 的辉夜号/SELENE 探测器(矿物学)的数据补齐了合集。总体而言,该数据集汇集了来自 9 台仪器、4 次任务的 30 多个空间对齐数据层。为防止训练、验证与测试数据之间泄漏,语料库按地图区域做地理划分,而非随机分配单个瓦片。

该模型基于多模态地球观测模型 TerraMind,但研究人员是将其从头训练,而非微调。对每个瓦片,模型接收成像几何作为显式上下文,包括光照角度、太阳位置和瓦片范围。在月球上,光照几何对地表外观的影响远大于地表本身的属性。团队没有强迫模型从原始像素中自行校正这一点,而是直接把该信息喂给它。模型还在单次训练中同时从高分辨率和粗分辨率图像中学习,从而同时捕获精细细节和大尺度上下文。一种名为 FlexiViT 的技术让同一个已训练模型无需重训即可适配不同图像补丁尺寸的任务。

团队在 100 米和 1 米尺度的撞击坑检测以及极区冰沉积预测上测试了该模型。它还必须分割不规则月海斑块(IMP)——这些年轻的火山特征对既有的月球冷却时间线构成挑战。根据技术报告,在所有任务上,预训练模型都追平或击败了常见基线以及一个架构完全相同但随机初始化的对照模型。

最大的增益出现在冰沉积预测上。永久阴影的极区足够寒冷,可以让水冰保存数十亿年,并被视为水、氧气和火箭燃料的潜在资源。据 IBM 称,与最佳基线 SwinV2-B 相比,该模型把预测误差最多降低了 22%。据 IBM 称,在粗尺度撞击坑检测上,该模型比 SwinV2-B 好了近 19%。这个数字来自只用一半数据训练,说明模型需要更少的标注样本就能表现良好。即便是随机初始化的对照模型,在没有任何月球预训练的情况下,也在冰预测上击败了 7 个基线中的 5 个。据研究人员称,部分优势来自它如何

核心信息

NASA 与 IBM Research 联合多家学术机构发布 NASA-IBM 月球基础模型,被称为最早的开源月球科学基础模型之一。模型用迄今最大的共配准多模态月球语料 SomBench 从头训练,汇聚 9 台仪器、4 次任务的 30 多个空间对齐数据层,主体来自月球勘测轨道器 17 年的观测。它在极区冰沉积预测上把误差最多降低 22%,粗尺度撞击坑检测比最强基线好近 19%,且只用了半数训练数据。

  • NASA 与 IBM Research 联合多家学术机构发布 NASA-IBM 月球基础模型,被称为最早的开源月球科学基础模型之一。模型用迄今最大的共配准多模态月球语料 SomBench 从头训练,汇聚 9 台仪器、4 次任务的 30 多个空间对齐数据层,主体来自月球勘测轨道器 17 年的观测。它在极区冰沉积预测上把误差最多降低 22%,粗尺度撞击坑检测比最强基线好近 19%,且只用了半数训练数据。
  • 原贴提到:The NASA-IBM Lunar Foundation Model makes decades of lunar observation d
  • 来源:the-decoder.com

详细解读

这是什么信号

NASA 与 IBM Research 联合多家学术机构,发布了 NASA-IBM 月球基础模型,并称其为最早的开源月球科学基础模型之一。它不是又一个“检测某个目标”的专用算法,而是先在大规模无标注月球数据上预训练、再用少量标注适配具体任务的通用底座。支撑它的是 SomBench——团队称为迄今最大的共配准多模态月球语料库:跨 11 种模态、两个空间尺度,近 200 万个瓦片包,主体来自月球勘测轨道器 17 年的观测,并汇入 GRAIL、月球勘探者号和日本辉夜号的数据,合计 9 台仪器、4 次任务的 30 多个空间对齐数据层。模型架构取自多模态地球观测模型 TerraMind,但是从头训练而非微调。

更值得注意的不是参数,而是工程判断。团队把成像几何(光照角度、太阳位置、瓦片范围)当作显式上下文直接喂给模型,因为在月球上,光照几何比地表真实属性更决定它“看起来什么样”;他们把高分辨率与粗分辨率放在同一次训练中联合学习;他们用 FlexiViT 让同一个模型适配不同图像补丁尺寸而不必重训;他们按地图区域而非随机瓦片切分训练/验证/测试,以堵住数据泄漏。这些都是做科学级基础模型时容易踩坑、又很少被公开讲清楚的地方。

为什么重要

月球研究长期处在“数据过剩、标注稀缺”的状态。LRO 一家的数据量据 NASA 称已超过所有其他 NASA 行星任务之和,但可用的人工标注始终是瓶颈。基础模型的范式正好对准这个错配:预训练吃掉海量无标注数据,下游任务只需要少量标注。实测结果支持这套逻辑——极区冰沉积预测误差比最佳基线 SwinV2-B 最多降低 22%;粗尺度撞击坑检测比 SwinV2-B 好近 19%,而且这个成绩只用了一半训练数据。需要更少标注就能达到更好效果,本身就是比单点精度更重要的信号。

还有一个细节值得咀嚼:即便随机初始化的对照模型,在没有任何月球预训练的情况下,也在冰预测上击败了 7 个基线中的 5 个。这说明基线设置和评测协议本身对结论影响很大,也提醒我们看待“基础模型带来多大提升”时要区分:提升里有多少来自预训练,多少来自架构、数据管道和上下文工程。

对谁有价值

第一类是有月球或行星遥感任务的科研团队:他们可以直接把这套开源权重和数据组织方式当作起点,把精力从“搭模型”转到“提科学问题”。第二类是遥感与地理空间 AI 的工程团队:SomBench 的共配准方法、按区域切分防泄漏、几何上下文显式注入、FlexiViT 适配多尺度,这些做法在地球观测任务里同样可迁移。第三类是关注 AI for Science 产品化的组织和投资人:这是“开源基础模型 + 稀缺领域数据”组合的一个具体样本,可以观察它后续的采用曲线,而不是只看发布当天的热度。第四类是月球资源相关的前瞻研究,因为冰沉积预测正是水、氧气和火箭燃料潜在供给的判据之一。

可以怎么行动

如果目标是复用:先读懂 SomBench 的模态、尺度和空间划分方式,再评估自己的数据能否对齐到同样的“30+ 空间对齐层”结构。如果目标是迁移到地球或其他天体:重点抄三点——把成像几何当输入而不是让模型猜;多尺度单次联合训练;按地理区域切分数据集而非随机切分。如果目标是做评测:不要只对比常见基线,一定要加一个架构相同、随机初始化的对照模型,否则无法判断增益来自预训练还是架构。如果目标是做内容或研究选题,可以从“光照几何是不是被低估的特征”“标注稀缺领域怎么用基础模型破局”这两个角度切入,它们比复述发布消息更有信息增量。

风险与限制

需要保持克制的地方有几点。其一,官方口径里明确披露的性能数字主要来自 IBM,且集中于冰沉积预测和粗尺度撞击坑检测两类任务,横向覆盖面仍然有限。其二,来源正文在最后一句被截断(“部分优势来自它如何……”),关于优势来源的完整解释并未给出,不应替它补全。其三,模型基于 TerraMind 但从头训练,意味着它继承了该架构的一系列设计取舍,这些取舍在月球这种极端光照条件下的边界表现尚未被完整披露。其四,永久阴影区冰沉积预测即便误差降低 22%,也不等于可以直接支撑工程决策,资源量评估仍需实地或更高置信度的验证。其五,不规则月海斑块分割这类直接挑战既有月球冷却时间线的任务,模型表现如何、误差结构怎样,公开信息还不足以判断。

信息差价值

这条内容的真正价值,不只是“有人发布了一个新功能”,而是它揭示了 the-decoder.com 背后的产品方向、工作流变化或竞争信号。对 OPC 来说,这种信息可以转化成持续追踪的栏目选题。

如果把《NASA 与 IBM 开源月球基础模型:把 17 年轨道器数据变成月球科学的地基》放到你的内容系统里,它最大的价值在于帮助读者更快看懂“为什么值得关注”,而不是只看到一条碎片化动态。

参考来源

AI SUMMARY

这篇文章回答了什么

NASA 与 IBM 开源月球基础模型:把 17 年轨道器数据变成月球科学的地基主要讲什么?

NASA 与 IBM Research 联合多家学术机构发布 NASA-IBM 月球基础模型,被称为最早的开源月球科学基础模型之一。模型用迄今最大的共配准多模态月球语料 SomBench 从头训练,汇聚 9 台仪器、4 次任务的 30 多个空间对齐数据层,主体来自月球勘测轨道器 17 年的观测。它在极区冰沉积预测上把误差最多降低 22%,粗尺度撞击坑检测比…

这篇文章最值得关注的要点是什么?

NASA 与 IBM Research 联合多家学术机构发布 NASA-IBM 月球基础模型,被称为最早的开源月球科学基础模型之一。模型用迄今最大的共配准多模态月球语料 SomBench 从头训练,汇聚 9 台仪器、4 次任务的 30 多…;原贴提到:The NASA-IBM Lunar Foundation Model makes decades of lunar observation d;来源:the-decoder.com

这篇文章和哪些AI专题相关?

它适合放在AI日报、AI工具、Agent工作流专题里阅读。 关联原因:这篇内容命中「热点解读」等主题信号。;这篇内容命中「模型」等主题信号。;这篇内容来自该专题长期覆盖的栏目。

阅读这篇文章建议先理解哪些关键词?

建议先理解AI日报、每日AI日报、AI信号、热点解读、BuilderPulse这些关键词,再结合正文判断工具、机会或风险是否值得进入自己的工作流。

上一篇 特朗普公布其新的超级智能部队 下一篇 LMSYS 发布开源聊天模型 Vicuna-13B,用 ShareGPT 对话微调 LLaMA,训练成本约 $300