一项由斯坦福大学、伦敦帝国学院和互联网档案馆联合开展的最新研究显示,到了2025年年中,新发布网站中约有35%可被识别为AI生成或AI辅助生成内容。研究指出,在2022年11月ChatGPT发布之前,这一比例几乎为零,意味着短短不到三年时间,AI内容已迅速渗透到互联网新内容生产之中。
这项题为《The Impact of AI-Generated Text on the Internet》的研究,基于互联网档案馆Wayback Machine提供的33个月网站快照展开,并使用名为Pangram v3的AI文本检测工具对网页内容进行分类。研究作者之一、伦敦帝国学院研究员Jonáš Doležal表示,AI接管网络内容的速度“令人震惊”,互联网在多年由人类塑造之后,正在被AI以极快速度重新定义。
AI内容占比上升,真正被验证的影响有哪些?
围绕AI内容是否正在“污染”互联网,研究团队测试了六项常见假设,但最终只有两项获得数据支持。首先是语义多样性下降。研究发现,AI生成网站之间的两两语义相似度,比人类撰写内容高出33%。这意味着,不同网站可能在重复表达相似观点,网络讨论的表达空间正在收缩。
研究认为,这种现象并不一定来自审查或协调行动,而更可能源于大语言模型天然倾向于生成贴近其训练分布中心的内容。换句话说,AI会优先输出“最常见、最稳妥”的说法,进而压缩网络中的观点边界。
第二个被证实的影响是“人工积极性”增强。数据显示,AI内容的正向情绪得分比人类内容高出107%以上。研究人员将这一现象与大模型常见的“迎合性”联系起来:由于模型在训练过程中大量接收人类反馈,它们更容易产出礼貌、顺滑、积极甚至过度乐观的文本。
从传播生态看,一个被高度积极化、情绪摩擦被抹平的互联网,可能会在不知不觉中削弱批判性表达、边缘化异议声音。研究者认为,这种变化未必会立即表现为虚假信息泛滥,但会对公共讨论的真实感和张力产生深远影响。
哪些担忧没有被数据证实?
值得注意的是,研究并未发现AI内容与事实准确性下降之间存在显著统计相关性。也就是说,尽管公众普遍担心AI生成文本会让互联网充斥错误信息,但至少在这项研究样本中,没有观察到AI占比上升与事实错误率同步增加的明确证据。
此外,另一项被广泛相信的假设——AI会让网络写作风格趋于单一——也未被证实。调查中有83%的受访者认同“风格单一化”说法,但研究基于字符层面的分析并未发现,AI占比上升会显著提高文体同质化程度。这说明公众认知与数据观察之间,仍存在不小差距。
35%占比意味着什么:模型坍塌风险从理论走向现实
研究最受关注的部分,或许并非内容质量本身,而是对下一代AI模型训练环境的潜在冲击。研究指出,当互联网中新内容有35%已经由AI参与生成时,所谓的“模型坍塌”(model collapse)风险,正从学术层面的假设转变为现实问题。
模型坍塌通常指,未来的基础模型如果越来越多地在AI生成数据上进行训练,可能会逐步失去对真实世界语言复杂性和多样性的把握,导致输出质量下降、信息维度收缩,甚至出现“模型学习模型”的循环退化。由于未来基础模型普遍依赖网络爬虫抓取当代互联网内容进行训练,研究者认为,它们几乎不可避免地将吸收大量AI生成且语义多样性更低的数据。
研究团队表示,接下来将与互联网档案馆合作,把这一研究发展成实时监测工具,持续追踪AI内容在网络中的占比变化,而不只是进行一次性的静态分析。这意味着,未来互联网“AI化程度”可能像链上数据指标一样,被持续量化和观察。
对科技与加密市场有何启示?
虽然这项研究并非直接针对加密货币行业,但其影响与数字资产生态高度相关。当前,加密市场的信息传播本就高度依赖社交媒体、新闻聚合平台、项目官网和社区论坛。如果互联网新增内容中已有超过三分之一带有AI痕迹,那么投资者接触到的项目解读、市场评论甚至教育内容,都可能在语义上更趋同、情绪上更乐观。
这对加密市场尤其值得警惕。因为数字资产本身波动大、叙事驱动强,若信息环境被“过度积极”的AI内容进一步强化,可能加剧市场FOMO情绪,放大投机叙事,而非提升决策质量。另一方面,研究未发现AI内容显著增加事实错误率,这也意味着AI工具并不必然等同于低质量信息,其关键风险更可能在于信息同质化与观点收缩。
从行业实践看,交易平台、项目方、研究机构和内容平台未来可能需要更重视内容来源标注、训练数据透明度以及AI生成内容识别机制。对于投资者而言,在阅读市场分析、项目白皮书解读或KOL评论时,除了关注事实真伪,也应警惕内容是否过于模板化、情绪是否被刻意“美化”。
总体来看,这项研究并未支持“互联网已死”的极端说法,但它给出了一个难以忽视的现实:到2025年年中,35%的新网站内容已由AI参与生产。在这一趋势下,互联网并非失去信息,而是可能逐渐失去多样性。对AI行业、科技平台以及依赖信息密度生存的加密市场而言,这都是一个需要尽快正视的结构性变化。

