皮尤研究证实自ChatGPT发布以来网络上AI生成文本急剧增加
皮尤研究中心分析近50万英文网页,发现ChatGPT发布后超过三分之一的新网页疑似AI生成,商业网站尤为突出,同时检测工具存在局限。
原贴
查看原文原文
中文翻译
在一项对近50万英文网页的分析中,皮尤研究中心发现,自ChatGPT发布后发布的网页中,超过三分之一显示出AI生成文本的迹象。使用Open Pangram检测工具分析了Common Crawl网络档案中的文本。商业.com域名包含AI生成文本的频率大约是.edu或.gov网站的十倍。不过,该分析有其局限性,主要因为当前的检测工具几乎无法区分完全自动化的文本和仅部分AI辅助的写作。
皮尤研究中心分析了近50万英文网页中的AI生成内容。自ChatGPT发布以来,在线机器撰写文本的比例急剧上升。这些文本来自Common Crawl网络档案,并使用AI检测工具Open Pangram进行了机器作者身份检查。在2026年7月的样本中,约10%的受检网页显示出明显的AI作者身份迹象。仅将样本过滤为ChatGPT发布后发布的页面,情况发生巨大变化。根据该分析,这些较新的页面中有超过三分之一显示出AI作者身份迹象。
这一趋势始于2022年底的ChatGPT,此后可能由AI生成的网页内容比例稳步上升。约十分之一的.com域名网页显示出AI作者身份迹象,而.org域名占4.6%,.edu和.gov域名各仅占约1%。这使得商业网站包含AI撰写文本的可能性大约是学校或政府机构网页的十倍。
皮尤的分析发现,自2023年以来,网络上有几种语言模式变得更加普遍。破折号现在出现的频率大约是2023年的两倍,牛津逗号的使用率跃升了63%。某些AI偏爱的词汇,如“delve”、“interplay”、“testament”、“pivotal”、“landscape”、“tapestry”、“bolstered”、“crucial”、“meticulous”和“vibrant”,出现频率增加了一倍以上。遵循“it's not just X, it's Y”模式的否定平行结构几乎增加了两倍,尽管绝对数量仍然很少。另一项针对企业公关文件的研究发现,这一特定短语自2022年以来翻了两番。
帝国理工学院、互联网档案馆和斯坦福大学2026年4月的一项研究得出了类似结论,发现约35%的新发布网站完全或部分由AI生成。研究人员还发现,AI文本之间的语义相似度高出33%,总体语气更加积极,但警告说,公众对负面影响的感知往往远超数据实际支持的程度。
这个问题也存在于这项研究及类似研究以及公共讨论中。没有人就“AI文本”的含义达成一致。其范围从完全自动化的内容到用AI润色的人类草稿,再到模型仅介入几个句子的文本。根据我测试数百篇自己文本的经验,Open Pangram及类似模型只能粗略判断文本可能是人类还是机器写的。它们无法可靠地告诉你AI参与了多少或在哪个阶段,而且仍然经常出错。然而,这些都是截然不同的工作方式。
核心信息
皮尤研究中心分析近50万英文网页,发现ChatGPT发布后超过三分之一的新网页疑似AI生成,商业网站尤为突出,同时检测工具存在局限。
- 皮尤研究中心分析近50万英文网页,发现ChatGPT发布后超过三分之一的新网页疑似AI生成,商业网站尤为突出,同时检测工具存在局限。
- 原贴提到:In an analysis of nearly half a million English-language web pages, the
- 来源:the-decoder.com
详细解读
这条信号清晰表明,ChatGPT的发布引爆了AI生成内容的浪潮。皮尤研究中心的报告不仅证实了这一趋势,还量化了其规模:在ChatGPT发布后的网页中,超过三分之一带有AI痕迹。这意味着,互联网上新增的内容中,很大一部分已经不再是纯粹的人类创作。
为什么重要?首先,对于搜索引擎和内容平台,AI内容的泛滥会改变信息生态,低质量或重复的AI内容可能淹没高质量的人类创作,影响用户体验。其次,对于商业网站,高达10%的.com页面含有AI文本,说明企业正在大规模采用AI工具来生产推广内容,这既是效率提升,也可能带来合规和信任风险。最后,对于普通用户,识别AI内容正变得越来越困难,这加剧了信息验证的挑战。
对谁有价值?内容创作者可以通过了解AI检测的局限性来优化自身策略,避免被误判。SEO从业者需要适应新的内容质量评估方式,因为搜索引擎可能调整算法来过滤低质AI内容。平台运营者需要制定规则,要求AI内容标注或限制滥用。企业公关部门则要警惕过度依赖AI文案可能带来的品牌风险。
可以怎么行动?一是建立内容标注体系,对于公开发布的信息,明确是否由AI辅助生成。二是加强检测工具研发,提高对“部分AI”的识别能力。三是内容生产者应注重原创性和深度,工具无法替代人类的洞察和价值观。四是平台方应结合内容质量和用户反馈,而非仅依赖AI检测。
风险或限制:皮尤研究依赖Open Pangram等检测工具,但作者也指出这些工具只能粗粒度判断,容易误判,尤其对混合创作无能为力。此外,“AI文本”的定义尚无共识,不同研究口径不同。因此,我们不应过度解读检测结果,而是关注AI内容对具体场景的实际影响。
信息差价值
这条内容的真正价值,不只是“有人发布了一个新功能”,而是它揭示了 the-decoder.com 背后的产品方向、工作流变化或竞争信号。对 OPC 来说,这种信息可以转化成持续追踪的栏目选题。
如果把《皮尤研究证实自ChatGPT发布以来网络上AI生成文本急剧增加》放到你的内容系统里,它最大的价值在于帮助读者更快看懂“为什么值得关注”,而不是只看到一条碎片化动态。
参考来源
TOPIC HUBS
延伸专题
AI SUMMARY
这篇文章回答了什么
皮尤研究证实自ChatGPT发布以来网络上AI生成文本急剧增加主要讲什么?
皮尤研究中心分析近50万英文网页,发现ChatGPT发布后超过三分之一的新网页疑似AI生成,商业网站尤为突出,同时检测工具存在局限。
这篇文章最值得关注的要点是什么?
皮尤研究中心分析近50万英文网页,发现ChatGPT发布后超过三分之一的新网页疑似AI生成,商业网站尤为突出,同时检测工具存在局限。;原贴提到:In an analysis of nearly half a million English-language web pages, the;来源:the-decoder.com
这篇文章和哪些AI专题相关?
它适合放在AI副业、AI工具、AI内容增长专题里阅读。 关联原因:这篇内容命中「项目、小生意、变现」等主题信号。;这篇内容命中「工具」等主题信号。;这篇内容命中「内容」等主题信号。
阅读这篇文章建议先理解哪些关键词?
建议先理解AI工具、工具、自动化、模型、Cursor这些关键词,再结合正文判断工具、机会或风险是否值得进入自己的工作流。