AI-Generated Content Now Represents 35% of New Websites: Stanford Study Reveals Semantic Decline and Positivity Bias, Model Collapse Risks Become Real

AI-Generated Content Now Represents 35% of New Websites: Stanford Study Reveals Semantic Decline and Positivity Bias, Model Collapse Risks Become Real

N
News Editor 01
2026-07-05 14:10:11
A joint study by Stanford, Imperial College, and Internet Archive finds 35% of new websites are AI-generated by mid-2025, causing 33% lower semantic diversity and 107% higher positivity. No factual accuracy drop observed, but model collapse shifts from theory to empirical risk, posing new challenges for Web3 content authenticity.

当人们还在争论AI是否会让互联网变成一片“废土”时,斯坦福大学、帝国理工学院与互联网档案馆联合发表的一项研究给出了第一个量化答案:截至2025年中期,全球新发布的网站中已有35%属于AI生成或AI辅助内容。而在2022年11月ChatGPT正式上线之前,这个数字几乎是零。

“AI接管互联网的速度令人震惊。”论文合著者、帝国理工学院研究员Jonáš Doležal对媒体表示,“短短三年内,人类数十年塑造的网络,已有很大一部分被AI重新定义。”研究团队利用互联网档案馆Wayback Machine长达33个月的网页快照,结合名为Pangram v3的AI文本检测器对每个页面进行分类,最终绘制出这一趋势的清晰图景。

六大假设仅两项证实:语义收缩与人工乐观

研究者测试了六种关于AI内容对网络影响的常见预设。结果只有两个获得了数据的支撑。

第一,网络正在陷入语义同质化——通俗地说,不同网站开始用几乎相同的方式表达相近的观点。AI生成内容之间的成对语义相似度比人类撰写内容高出33%。论文指出,线上“话语窗口”可能在缩小,并非通过审查或有组织的运动,而是因为语言模型天然倾向于生成接近其训练分布的输出。这意味着个体表达的多样性正在被系统性地侵蚀。

第二,网络正在变得“过分阳光”。AI内容的积极情感得分比人类内容高出107%以上。研究者将这种现象归因于语言模型“谄媚”的本性:模型被训练去迎合人类偏好,因此产出安全、去摩擦、毫无保留的正能量文本。一个被欢快、同质化内容淹没的互联网,可能在无声无息中边际化人类异议,且无需任何人刻意操纵。

令人意外:事实准确性并未恶化,风格也未单调化

尽管大多数受访者认为AI正在让网络变得更不准确、更单调,数据却给出了相反的结果。研究未发现AI流行度与事实错误率之间存在统计显著的关联。同样,“风格单一化”的假设——即AI让所有人沦为统一的写作腔调——也被数据否定:字符级分析显示,AI使用率与风格同质性之间没有显著相关性。

值得注意的是,随研究同步进行的美国公众调查显示,大部分人对AI的所有六项负面假设都表示认同——包括那些数据不支持的部分。使用AI频率较低的人相信这些危害的可能性比高频用户高出12%。“死互联网理论”的信仰者可能需要重新审视:互联网并未死去,但35%的新内容在某种意义上已成为“僵尸内容”。

模型崩溃风险从假设转向现实

比话语质量更深层的隐忧在于下一波AI模型的训练基础。当35%的线上新文本由AI产生时,“模型崩溃”这一此前停留在理论阶段的风险,已然成为可观测的实证问题。未来基于网络爬虫训练的下一代模型,将不可避免地吸收大量由AI生成、且语义多样性显著降低的数据。这可能导致模型能力退化、输出进一步趋同,形成恶性循环。

研究团队目前正与互联网档案馆合作,将此次调查转化为持续、实时的监测工具,以便实时追踪AI在互联网中的占比,而非仅提供一次性快照。

对加密世界的潜在冲击

对于依靠链上数据、预言机喂价以及社区共识运行的加密生态系统而言,AI生成内容的泛滥直接威胁到信息真实性的“根”。DeFi协议依赖的外部数据源如果被AI生成的虚假乐观或同质化信息污染,可能导致定价偏离、清算误判。NFT与元宇宙领域中,AI生成内容的语义趋同可能进一步稀释数字艺术的稀缺性——当每一件“新”作品都散发着相似的微笑时,收藏价值何存?

更重要的是,区块链社区自身的内容生态——从项目白皮书到社交媒体讨论——也难逃AI侵蚀。如果35%的加密相关新网页是AI生成的,那么社区在做出投资或治理决策时,将面临前所未有的信息甄别困境。这或许会倒逼加密行业更积极地采用零知识证明、去中心化身份(DID)和内容指纹溯源技术来区分人类与AI的贡献。

研究最后引用的那句话或许值得每个加密从业者铭记:“互联网并未死去,但35%的新内容在某种程度上已是僵尸内容。”在Web3迈向主流采纳的关键路口,区分“活”的内容与“僵尸”内容,正在从哲学讨论变成生存需求。

This article was originally published by Bit.Fan. For more cryptocurrency news and market insights, visit www.bit.fan.
100

Disclaimer:

The market information, project data, and third-party content displayed on this platform are for industry information sharing only and do not constitute any form of investment advice or return commitment.

Cryptocurrency trading carries high risks. Users should fully assess their risk tolerance and make independent decisions. All profits, losses, and legal responsibilities are borne by the users themselves.