一项由斯坦福大学、帝国理工学院和互联网档案馆联合发布的新研究首次量化了AI对互联网的渗透程度:截至2025年中,35%的新建网站被归类为AI生成或AI辅助。这一数字在2022年11月ChatGPT发布前几乎为零。研究团队利用互联网档案馆Wayback Machine的33个月网站快照,结合名为Pangram v3的AI文本检测器,对数百万网页进行了分类分析。
确证的两大危害:语义收缩与虚假积极
研究检验了关于AI内容影响的六项假设,仅有两项得到数据支持。第一,网络的语义多样性正在下降。AI生成网站成对语义相似度得分比人类撰写网站高出33%。这意味着同样的想法被以几乎相同的方式反复表达,在线话语的“奥弗顿窗口”可能正在通过语言模型的优化路径被动收窄,而非通过审查或协调运动。
第二,网络正在变得异常乐观。AI内容的积极情绪得分比人类内容高出107%以上。研究人员将这一现象归因于大语言模型(LLM)固有的谄媚倾向——它们在人类反馈信号上训练,倾向于生成安全、无摩擦、持续积极的文本。这种“表面欢快”可能在大规模上边缘化人类的异议声音,却没有任何人刻意操控。
未被证实的常见担忧:事实错误与风格同质化
尽管公众普遍认为AI内容正在使互联网变得不准确(调查中多数受访者赞同所有负面假设),但研究发现AI盛行率与事实错误率之间没有统计上显著的关联。同样,最被受访者笃信的“风格单一化”假设(83%同意)也未获支持:字符级分析发现AI盛行率与风格同质化之间无统计学显著增长。研究指出,人们高估了AI破坏事实基础的规模,但其对语言多样性的实际侵蚀却往往被忽视。
模型崩溃:从理论担忧到实证现实
研究的更深远影响在于基础模型训练的未来。当35%的新增网页由AI生成时,下一代基础模型在训练时将不可避免地摄入大量AI生成、语义多样性降低的数据。这使此前仅限于学术讨论的“模型崩溃”风险转变为可实证的现实威胁——模型在自生成数据上反复训练后性能会退化。研究团队正与互联网档案馆合作,将此次分析转化为实时监控工具,持续跟踪AI在互联网内容中的占比,而非仅做一次性的静态评估。
“死互联网理论”遭遇数据:网络未死,但35%的新内容已是“僵尸”
研究中同时进行的美国调查显示,低频使用AI的受访者比高频用户更容易相信AI内容的所有负面假设(高出12%)。这与“死互联网理论”的部分观点形成呼应——网络正在被机器填充,但这些机器内容并非完全虚假,而是缺乏语义深度和情感复杂度。“网络未死,但35%的新东西在某种程度上都是僵尸内容。” 研究人员乔纳·多莱扎尔表示:“AI在短短三年内重新定义了互联网的相当一部分,速度令人震惊。”

