AI觉醒星球
Awakening is here
Knowledge File / 全球热点解读
2026-06-05 4 浏览 公开

趋势解读:Microsoft trained its MAI models on unlicensed web,提升开发者接入体验

微软承认部分使用未经许可的网络数据训练MAI模型,与之前声称的仅使用商业许可数据相矛盾,引发对AI公司数据合规性的讨论。

SOURCE / 全球热点解读 MIN / 4 ACCESS / 公开 POST / 2026-06-05 20:10:26

原贴

查看原文
作者:Matthias Bastian 来源站点:the-decoder.com 原贴时间:

原文

Microsoft partly trained its new MAI models on unlicensed web data. The technical paper shows Microsoft used Common Crawl, among other sources, as Simon Willison noted. Microsoft had previously claimed the MAI models were trained only on "enterprise grade, clean and commercially licensed data." Like other AI companies scraping the web, Microsoft is likely relying on fair use . The paper describes the data as a "mixture of publicly available and licensed human-generated data." For web data, Microsoft says it uses "a proprietary crawler that respects the Robots Exclusion Protocol (robots.txt) and related meta-tag and HTML controls, enabling site owners to manage how content on their sites is accessed and used." That puts the burden of protecting content on site owners, like assuming anyone who doesn't lock their door consents to a break-in. Fair use remains contested , and courts are still sorting it out . In short, Microsoft does what every other AI company does, yet sells its training data as especially "clean." It isn't. Ad DEC_D_Incontent-1 Ad Subscribe to THE DECODER for ad-free reading, a weekly AI newsletter, our exclusive "AI Radar" frontier report six times a year, full archive access, and access to our comment section.

中文翻译

微软部分使用了未经许可的网络数据来训练其新的MAI模型。正如西蒙·威利森指出的,技术论文显示微软使用了Common Crawl等来源。微软此前曾声称MAI模型仅使用“企业级、干净且商业许可的数据”进行训练。与其他抓取网络的人工智能公司一样,微软可能依赖合理使用。论文将数据描述为“公开可用和经许可的人类生成数据的混合物”。对于网络数据,微软表示其使用“尊重机器人排除协议(robots.txt)及相关元标记和HTML控制的专有爬虫,使网站所有者能够管理其网站内容的访问和使用方式”。这将保护内容的负担转嫁给了网站所有者,类似于假设任何不锁门的人都同意入室盗窃。合理使用仍然存在争议,法院仍在解决这个问题。简而言之,微软做了所有其他人工智能公司所做的事情,却将其训练数据宣传为特别“干净”,事实并非如此。

核心信息

微软承认部分使用未经许可的网络数据训练MAI模型,与之前声称的仅使用商业许可数据相矛盾,引发对AI公司数据合规性的讨论。

  • 微软MAI模型未经许可使用Common Crawl数据
  • 与之前声称的'商业许可数据'宣传矛盾
  • 依赖合理使用原则,将合规责任推给网站
  • 引发对AI数据灰色地带的行业反思
  • 加速版权诉讼和监管政策出台

详细解读

这是什么信号

微软承认其MAI模型部分使用了未经许可的网络数据(如Common Crawl),直接推翻了此前“仅使用企业级、干净且商业许可数据”的宣传。这表明在AI军备竞赛中,即使是巨头也难以避免使用公开网络数据,所谓的“干净数据”更多是营销话术。

为什么重要

此举揭示了AI行业普遍存在的数据灰色地带:依赖合理使用和robots.txt的被动保护机制,将合规责任转移给内容生产者。随着版权诉讼增多(如纽约时报诉OpenAI),此事件可能成为影响判例的关键证据,动摇AI公司对网络数据使用的合法性基础。

对谁有价值

- 内容创作者和出版商:需主动使用robots.txt限制爬取,并考虑法律维权途径。
- AI开发者和创业者:应重新评估训练数据来源的合规风险,优先采购授权数据或使用开放数据集。
- 投资者和法律从业者:关注相关诉讼进展,此案可能影响AI公司估值和行业监管走向。

可以怎么行动

- 内容平台:立即审计robots.txt配置,明确禁止AI爬取,并加入“AI训练数据许可联盟”等行业组织。
- AI企业:建立数据来源审计流程,对未经许可的数据进行脱敏或过滤;在模型发布时披露数据构成,提升透明度。
- 企业采购方:在合同条款中要求AI供应商提供训练数据合规证明,降低法律连带风险。

风险或限制

微软的爬虫虽遵守robots.txt,但大量网站未设置或设置不当,实际仍被默认抓取。合理使用原则在不同司法辖区解释不一,短期难有统一裁决;集体诉讼可能旷日持久。此外,数据合规成本将推高AI研发门槛,加速行业洗牌。

信息差价值

这条内容的信息差价值在于:多数开发者只看到微软AI产品功能,而忽略了其数据来源的合规隐患。实际上,微软内部文档与公开说辞的不一致,揭示了AI行业普遍存在的“数据漂绿”现象——企业用合规标签美化实际行为。对于OPC读者,这不仅是新闻,更是业务决策的警示:采购AI服务时不能只看宣传,必须要求供应商提供数据溯源报告。

业务启发:企业可借鉴此事件建立“AI数据合规框架”,包括数据来源分级、第三方审计和员工培训。例如,内容平台可推出“AI友好型版权许可”增值服务,既保护自身权益,又为AI公司提供合法数据源,创造新收入流。

可沉淀动作:1)将数据合规纳入AI供应商评估表,权重不低于性能指标;2)定期检测自身网站robots.txt及元标签,确保爬虫策略及时更新;3)加入行业倡议,推动统一的数据使用标准,降低合规成本。这些动作能帮助企业规避风险,同时抢占合规红利。

参考来源

上一篇 趋势解读:Florida's lawsuit against OpenAI and CEO Altman treats,解读最新 AI 进展 下一篇 【必读】每日AI日报 2026-06-05(2026-06-05)