一项由斯坦福大学、伦敦帝国理工学院和互联网档案馆联合开展的研究显示,截至2025年中,约35%的新发布网站被判定为由AI生成或在AI辅助下完成。这一比例在2022年11月ChatGPT发布前几乎为零,意味着仅用不到三年时间,生成式AI就快速改写了互联网新增内容的生产方式。
这项题为《The Impact of AI-Generated Text on the Internet》的研究,基于互联网档案馆Wayback Machine在33个月内保存的网站快照,并通过名为Pangram v3的AI文本检测工具对网页进行分类。研究团队试图回答一个正在影响科技、媒体乃至加密行业的问题:当AI内容大规模涌入网络,互联网究竟发生了什么变化?
研究发现:真正被证实的影响并非“假信息泛滥”
研究人员测试了六项关于AI内容影响互联网的假设,但最终只有两项获得数据支持。首先是语义多样性下降。数据显示,AI生成网站之间的两两语义相似度比人类撰写内容高出33%。换句话说,互联网上越来越多的新内容,可能在表达方式、观点组织和信息框架上趋于相似,造成讨论空间收窄。
第二项得到验证的影响是“人工乐观”倾向显著增强。研究指出,AI内容的正向情绪评分比人类内容高出107%以上。这意味着大量由大语言模型生成的网页文本,更倾向于使用积极、平滑、低冲突的语言风格。研究者认为,这与LLM在训练中受到“迎合用户偏好”信号影响有关,最终形成一种去摩擦、去尖锐、持续正面的表达方式。
值得注意的是,社会舆论普遍担心AI会让网络信息更不准确,甚至加剧错误信息传播,但这项研究并未找到统计学上显著的证据支持这一点。研究人员表示,AI内容占比与事实错误率之间没有发现有意义的相关性。同样,公众普遍认为AI会抹平个体写作风格、让互联网变成“文风单一”的模板化空间,但字符级分析并未证实这一说法。
“模型坍塌”风险从理论走向现实
相比内容审美层面的变化,更受技术行业关注的是所谓“模型坍塌”风险。该概念通常指未来AI模型在训练时,如果越来越多地吸收由旧模型生成的数据,可能导致输出质量下降、偏差累积,甚至让新模型逐渐失去对真实世界复杂语义的把握能力。
研究认为,当互联网新增内容中已有35%由AI生成或辅助生成时,这一风险不再只是学术讨论,而开始具备现实基础。原因在于,未来基础模型若继续依赖当代网页抓取数据进行训练,将不可避免地摄入大量AI文本,而这些文本已经被证明具有更低的语义多样性和更强的情绪正向偏置。这可能改变下一代模型对语言、知识和社会表达的理解边界。
研究团队目前正与互联网档案馆合作,希望将该项目升级为持续性的实时监测工具,以动态追踪AI内容在互联网中的占比变化,而非仅仅停留在阶段性快照上。
对加密行业意味着什么
虽然这项研究并非直接聚焦加密货币市场,但其结论对Web3、加密媒体、链上社区和项目营销具有明显启发。加密行业本就高度依赖在线内容生态,从项目白皮书、代币分析、新闻快讯,到社交平台上的市场情绪塑造,几乎都建立在高速传播的信息流之上。一旦AI内容占比持续上升,行业面临的首要问题可能不是“真假难辨”,而是观点趋同、叙事收缩和情绪失真。
对于投资者而言,这意味着未来在阅读市场评论、项目解读和行情分析时,可能会更频繁地接触到“措辞不同但本质相似”的内容。这种内容同质化会削弱独立研究的辨识度,也可能放大市场中的羊群效应。特别是在牛市周期中,若AI生成文本天然更乐观,那么它可能在舆论层面进一步强化风险偏好,使散户更容易受到单边乐观情绪影响。
对加密项目方和内容平台而言,这项研究也释放出一层信号:AI可以显著提高内容生产效率,但若过度依赖,可能反而损害品牌的长期可信度与差异化表达。在竞争激烈的Web3生态中,真正稀缺的可能不再是内容数量,而是高质量、可验证、具有人类判断力的原创内容。
总体来看,这项研究并未支持“互联网已被AI假信息彻底占领”的极端论断,但它清晰揭示了另一个更值得警惕的趋势:互联网新增内容正在变得更相似、更乐观,也更适合被机器继续学习。对于依赖信息优势做决策的加密市场参与者来说,这或许意味着未来的核心竞争力,将越来越取决于筛选能力、验证能力以及对真实信号的把握能力。

