如果互联网的信噪比继续下降,最先承压的会是依赖搜索流量的内容生产者。
TechFlowPost刊发的这篇文章援引 Pew Research Center 本周发布的一项研究称,研究团队基于 Common Crawl 网络档案,对 2021 年 1 月至 2026 年 7 月之间的 49 次网页抓取分别随机抽样 1 万个英文网页,总计约 49 万个页面,并使用名为 Open Pangram 的 AI 检测模型逐页扫描。
新增网页中的 AI 参与比例明显上升
按研究给出的结果,2026 年 7 月的全量快照中,约 10% 的英文网页呈现出「显著的 AI 写作或深度编辑迹象」。如果只统计 ChatGPT 于 2022 年 11 月 30 日发布之后上线的网页,这一比例升至 35%。
文章同时强调,35% 并不等于三分之一的整个互联网都由 AI 写成,因为网络上仍保留着大量 2022 年之前形成的存量页面。这个数字更直接反映的是新增内容的变化:AI 参与撰写,正在从例外变成常态。
不同域名的 AI 痕迹分布并不均匀
从域名类型看,AI 写作特征在不同网络空间中的渗透速度并不一致。
- .com 域名下,约十分之一的页面在 2026 年样本中呈现 AI 写作特征;
- .org 域名为 4.6%;
- .edu 和 .gov 域名均约为 1%。
按这一组数据,.com 域名页面中的相关比例不仅是 .org 的两倍多,也约为 .edu 和 .gov 的十倍,商业互联网吸收 AI 写作工具的速度明显快于学术和政府机构。
语言指纹也在朝 AI 文本分布靠拢
Pew 的研究还拆解了 AI 写作常见的语言特征。与 2023 年相比,2026 年新网页中 em dash(破折号)的使用频率翻倍,Oxford comma(牛津逗号)增加了 63%,AI 模型偏好的词汇——例如 delve、interplay、tapestry、pivotal——使用量翻了一倍以上,而「it's not just X, it's Y」这一否定并列句式的出现频率接近三倍。
文中指出,这些单独出现时都不足以构成判断依据,但在统计聚合后,呈现出一个更清晰的方向:新网页的语言纹理,正在向 AI 生成文本的特征分布靠近。
另一组变化:机器流量已超过人类流量
Pew 的报告关注的是「谁在写」,文章则把这一结论与另一组关于流量的数据放在一起观察。
2026 年 6 月 3 日,Cloudflare CEO Matthew Prince 在社交媒体上表示,AI 机器人流量首次超过人类流量,占全球网页 HTTP 请求的 57.4%。他称,自己原本预计这一交叉点会在 2027 年底出现,实际提前了 18 个月。
HUMAN Security 在 2026 年发布的报告也给出了相同方向的数据:2025 年全年,AI 驱动的自动流量增速是人类流量增速的 8 倍,其中代理型 AI(agentic AI,即代替用户执行任务的 AI)流量同比增长近 8000%。
把供给侧和需求侧放在一起,图景变得更完整:一边是新增网页中有三分之一由 AI 参与撰写,另一边是超过一半的「读者」已经是机器。文章据此指出,一个原本服务于人类交流的基础设施,正在加快转向机器写给机器看的信息通道。
递归训练风险与「模型坍缩」问题
文中认为,这不仅是内容质量变化的问题,也关系到 AI 行业本身的训练基础。
2024 年,Nature 发表了一篇来自牛津和剑桥研究团队的论文,指出 AI 模型在递归训练——也就是用 AI 生成的数据训练下一代 AI——过程中会出现「模型坍缩」(model collapse):输出会逐渐偏离真实世界的数据分布,尾部分布中的稀有模式会丢失,几代迭代之后,内容会越来越同质化,甚至失去意义。
Epoch AI 的研究者则预测,适合训练 AI 的高质量人类原创文本,可能会在 2026 年到 2032 年之间耗尽。
这条循环路径已经很清楚:AI 模型读取人类互联网,批量生成新网页;这些网页被搜索引擎收录,再被 Common Crawl 一类工具抓取归档;随后,下一代模型继续使用这些数据训练。每轮循环里,「AI 写 AI」的数据占比都在上升,来自人类一手经验的信号则被持续稀释。
搜索流量依赖型内容生产者面临更直接冲击
文章认为,如果互联网信噪比继续恶化,最早受到影响的就是依赖搜索分发的内容生产者。
当搜索结果被大量同质化的 AI 改写内容占据,读者会更难区分「原件」和「复印件」。Google 已在用 AI Overview 取代部分搜索结果中的点击链接。Pew 今年 7 月的另一项研究显示,只有 20% 的用户认为 AI 搜索摘要「非常有用」,仅 6% 的用户表示「非常信任」。
在这样的环境下,文章提出,真正具备稀缺性的将是能够提供一手现场信息、独家数据和文件、可追溯到具体人类来源的观点与判断,以及读者愿意为之付费的编辑品味的媒体。
媒体竞争指标正在变化
从这个角度看,衡量媒体竞争力的方式也在变化。发稿数量本身不再是壁垒,AI 可以一天生成 1000 篇内容,真正的壁垒变成了「可证明的人类原创」:一篇稿件中的信息究竟来自记者采访和核实,还是来自模型生成;一项判断究竟出自有行业经验的编辑,还是由 prompt 拼接而来。
文章最后写道,在一个 35% 新网页都带有 AI 痕迹的互联网里,谁能回答清楚这些问题,谁就拥有竞争优势。


