Stanford Study: 35% of New Websites Are AI-Generated, Web Faces Semantic Homogeneity and Forced Positivity

Stanford Study: 35% of New Websites Are AI-Generated, Web Faces Semantic Homogeneity and Forced Positivity

N
News Editor 01
2026-07-05 14:10:11
A Stanford-led study found that by mid-2025, 35% of newly published websites are AI-generated or AI-assisted, causing decreased semantic diversity and artificially inflated positivity, while factual accuracy and stylistic variety remain unaffected. Model collapse risk becomes empirical.

一项由斯坦福大学、帝国理工学院和互联网档案馆联合发布的新研究首次量化了AI对互联网的渗透程度:截至2025年中,35%的新建网站被归类为AI生成或AI辅助。这一数字在2022年11月ChatGPT发布前几乎为零。研究团队利用互联网档案馆Wayback Machine的33个月网站快照,结合名为Pangram v3的AI文本检测器,对数百万网页进行了分类分析。

确证的两大危害:语义收缩与虚假积极

研究检验了关于AI内容影响的六项假设,仅有两项得到数据支持。第一,网络的语义多样性正在下降。AI生成网站成对语义相似度得分比人类撰写网站高出33%。这意味着同样的想法被以几乎相同的方式反复表达,在线话语的“奥弗顿窗口”可能正在通过语言模型的优化路径被动收窄,而非通过审查或协调运动。

第二,网络正在变得异常乐观。AI内容的积极情绪得分比人类内容高出107%以上。研究人员将这一现象归因于大语言模型(LLM)固有的谄媚倾向——它们在人类反馈信号上训练,倾向于生成安全、无摩擦、持续积极的文本。这种“表面欢快”可能在大规模上边缘化人类的异议声音,却没有任何人刻意操控。

未被证实的常见担忧:事实错误与风格同质化

尽管公众普遍认为AI内容正在使互联网变得不准确(调查中多数受访者赞同所有负面假设),但研究发现AI盛行率与事实错误率之间没有统计上显著的关联。同样,最被受访者笃信的“风格单一化”假设(83%同意)也未获支持:字符级分析发现AI盛行率与风格同质化之间无统计学显著增长。研究指出,人们高估了AI破坏事实基础的规模,但其对语言多样性的实际侵蚀却往往被忽视。

模型崩溃:从理论担忧到实证现实

研究的更深远影响在于基础模型训练的未来。当35%的新增网页由AI生成时,下一代基础模型在训练时将不可避免地摄入大量AI生成、语义多样性降低的数据。这使此前仅限于学术讨论的“模型崩溃”风险转变为可实证的现实威胁——模型在自生成数据上反复训练后性能会退化。研究团队正与互联网档案馆合作,将此次分析转化为实时监控工具,持续跟踪AI在互联网内容中的占比,而非仅做一次性的静态评估。

“死互联网理论”遭遇数据:网络未死,但35%的新内容已是“僵尸”

研究中同时进行的美国调查显示,低频使用AI的受访者比高频用户更容易相信AI内容的所有负面假设(高出12%)。这与“死互联网理论”的部分观点形成呼应——网络正在被机器填充,但这些机器内容并非完全虚假,而是缺乏语义深度和情感复杂度。“网络未死,但35%的新东西在某种程度上都是僵尸内容。” 研究人员乔纳·多莱扎尔表示:“AI在短短三年内重新定义了互联网的相当一部分,速度令人震惊。”

This article was originally published by Bit.Fan. For more cryptocurrency news and market insights, visit www.bit.fan.
200

Disclaimer:

The market information, project data, and third-party content displayed on this platform are for industry information sharing only and do not constitute any form of investment advice or return commitment.

Cryptocurrency trading carries high risks. Users should fully assess their risk tolerance and make independent decisions. All profits, losses, and legal responsibilities are borne by the users themselves.