斯坦福大学、帝国理工学院与互联网档案馆联合发布的最新研究显示,截至2025年中,全球新发布网站中高达35%由人工智能生成或辅助完成。这一数字在2022年11月ChatGPT上线前几乎为零。研究团队通过分析互联网档案馆Wayback Machine的33个月快照数据,并使用AI文本检测工具Pangram v3进行分类,得出了这一令人震惊的结论。
语义收缩与人工乐观:AI内容的双重效应
研究对AI内容对互联网影响的六项假设进行了验证,仅有两项获得数据支持。第一项是语义多样性显著下降:AI生成网站之间的成对语义相似度比人工撰写内容高出33%,相同观点以几乎一致的方式反复表达。论文指出,这可能导致网络空间的“奥弗顿窗口”收窄——不是通过审查或协调行动,而是因为语言模型优化了接近其训练分布的输出,从而限制了讨论的广度。
第二项是过度积极的情绪表达:AI内容的正面情绪得分比人类内容高出107%以上。研究人员将这一现象归因于大语言模型固有的“谄媚”倾向——这些模型基于人类认可信号训练,倾向于输出经过净化、无摩擦、持续乐观的文本。一个充斥着欢快、同质化内容的互联网可能在大规模上边缘化人类异议,而无需任何人为操控。
值得一提的是,尽管公众普遍担忧AI会降低事实准确性,但研究并未发现AI内容与事实错误率之间存在统计显著的相关性。同样,关于“风格同质化”的假设(83%受访者认为AI会抹杀个人风格)也未得到数据支持。字符级分析显示,AI普及率与风格同质性之间没有统计显著关联。
模型崩塌从理论走向实证:加密货币数据生态面临挑战
研究的更大警示在于,当AI生成内容占比达到35%时,模型崩溃的理论风险已转化为经验现实。所谓模型崩溃,是指未来一代的基础模型在训练时若摄入大量AI生成数据,可能导致模型性能退化。由于AI内容在语义多样性上明显不足,未来网络爬虫获取的数据集会不可避免地包含大量这类低多样性文本,从而影响下一代大语言模型的可靠性。
这一发现对加密货币市场尤为重要。许多去中心化预言机、链上数据分析平台以及AI驱动的交易策略都依赖网络数据的实时抓取。如果网络数据日趋同质化且过度乐观,可能导致链上数据源的偏差,影响智能合约对现实世界事件的准确响应。例如,基于自然语言处理的链上情绪指数可能因AI内容的“假笑”而失真,进而误导交易策略。
此外,研究团队正与互联网档案馆合作,将这一研究转化为持续、实时的监控工具,以实时追踪AI在互联网中的占比。这意味着未来数据质量评估将更加透明,也可能促使加密货币项目方重新审视其数据获取和训练流程。
公众认知与数据现实的鸿沟
伴随研究发布的一项美国调查显示,大多数受访者相信所有六项负面假设,包括那些未被数据支持的假设。不常使用AI的人比频繁用户更可能相信AI的危害(高出12%)。这反映了“死互联网理论”的持续影响力——即认为互联网已被僵尸内容淹没。但实际数据表明,互联网并未“死亡”,但35%的新增内容确实具有某种“僵尸”特性:它们是同质化、过度乐观的,而非事实错误或风格单一。
对于加密货币行业而言,这一发现意味着:第一,链上数据源的清洗和验证机制需要强化,以过滤AI生成的噪声;第二,依赖网络语料的AI项目应警惕训练数据质量下降的风险;第三,去中心化内容创作平台(如基于区块链的内容发布系统)可能因AI内容的涌入而面临识别与审核的新挑战。正如论文合著者Jonáš Doležal所言:“在短短三年内,AI定义了互联网的很大一部分,这种速度令人震惊。”

