Pew:ChatGPT 发布后新网页中 35% 带有 AI 写作痕迹

Pew:ChatGPT 发布后新网页中 35% 带有 AI 写作痕迹

N
News Editor
2026-08-21 02:32:58
Pew Research Center 基于 Common Crawl 的分析显示,2026 年 7 月全量快照中约 10% 的英文网页存在显著 AI 写作或深度编辑迹象;若只看 ChatGPT 于 2022 年 11 月 30 日发布后上线的网页,这一比例升至 35%。报告同时指出,.com 域名网页的 AI 痕迹比例明显高于 .org、.edu 和 .gov。文章还结合 Cloudflare 与 HUMAN Security 数据,讨论机器生成内容与机器流量同步上升对互联网原创内容生态的影响。

如果互联网的信噪比继续下降,最先承压的会是依赖搜索流量的内容生产者。

TechFlowPost刊发的这篇文章援引 Pew Research Center 本周发布的一项研究称,研究团队基于 Common Crawl 网络档案,对 2021 年 1 月至 2026 年 7 月之间的 49 次网页抓取分别随机抽样 1 万个英文网页,总计约 49 万个页面,并使用名为 Open Pangram 的 AI 检测模型逐页扫描。

新增网页中的 AI 参与比例明显上升

按研究给出的结果,2026 年 7 月的全量快照中,约 10% 的英文网页呈现出「显著的 AI 写作或深度编辑迹象」。如果只统计 ChatGPT 于 2022 年 11 月 30 日发布之后上线的网页,这一比例升至 35%。

文章同时强调,35% 并不等于三分之一的整个互联网都由 AI 写成,因为网络上仍保留着大量 2022 年之前形成的存量页面。这个数字更直接反映的是新增内容的变化:AI 参与撰写,正在从例外变成常态。

不同域名的 AI 痕迹分布并不均匀

从域名类型看,AI 写作特征在不同网络空间中的渗透速度并不一致。

  • .com 域名下,约十分之一的页面在 2026 年样本中呈现 AI 写作特征;
  • .org 域名为 4.6%;
  • .edu 和 .gov 域名均约为 1%。

按这一组数据,.com 域名页面中的相关比例不仅是 .org 的两倍多,也约为 .edu 和 .gov 的十倍,商业互联网吸收 AI 写作工具的速度明显快于学术和政府机构。

语言指纹也在朝 AI 文本分布靠拢

Pew 的研究还拆解了 AI 写作常见的语言特征。与 2023 年相比,2026 年新网页中 em dash(破折号)的使用频率翻倍,Oxford comma(牛津逗号)增加了 63%,AI 模型偏好的词汇——例如 delve、interplay、tapestry、pivotal——使用量翻了一倍以上,而「it's not just X, it's Y」这一否定并列句式的出现频率接近三倍。

文中指出,这些单独出现时都不足以构成判断依据,但在统计聚合后,呈现出一个更清晰的方向:新网页的语言纹理,正在向 AI 生成文本的特征分布靠近。

另一组变化:机器流量已超过人类流量

Pew 的报告关注的是「谁在写」,文章则把这一结论与另一组关于流量的数据放在一起观察。

2026 年 6 月 3 日,Cloudflare CEO Matthew Prince 在社交媒体上表示,AI 机器人流量首次超过人类流量,占全球网页 HTTP 请求的 57.4%。他称,自己原本预计这一交叉点会在 2027 年底出现,实际提前了 18 个月。

HUMAN Security 在 2026 年发布的报告也给出了相同方向的数据:2025 年全年,AI 驱动的自动流量增速是人类流量增速的 8 倍,其中代理型 AI(agentic AI,即代替用户执行任务的 AI)流量同比增长近 8000%。

把供给侧和需求侧放在一起,图景变得更完整:一边是新增网页中有三分之一由 AI 参与撰写,另一边是超过一半的「读者」已经是机器。文章据此指出,一个原本服务于人类交流的基础设施,正在加快转向机器写给机器看的信息通道。

递归训练风险与「模型坍缩」问题

文中认为,这不仅是内容质量变化的问题,也关系到 AI 行业本身的训练基础。

2024 年,Nature 发表了一篇来自牛津和剑桥研究团队的论文,指出 AI 模型在递归训练——也就是用 AI 生成的数据训练下一代 AI——过程中会出现「模型坍缩」(model collapse):输出会逐渐偏离真实世界的数据分布,尾部分布中的稀有模式会丢失,几代迭代之后,内容会越来越同质化,甚至失去意义。

Epoch AI 的研究者则预测,适合训练 AI 的高质量人类原创文本,可能会在 2026 年到 2032 年之间耗尽。

这条循环路径已经很清楚:AI 模型读取人类互联网,批量生成新网页;这些网页被搜索引擎收录,再被 Common Crawl 一类工具抓取归档;随后,下一代模型继续使用这些数据训练。每轮循环里,「AI 写 AI」的数据占比都在上升,来自人类一手经验的信号则被持续稀释。

搜索流量依赖型内容生产者面临更直接冲击

文章认为,如果互联网信噪比继续恶化,最早受到影响的就是依赖搜索分发的内容生产者。

当搜索结果被大量同质化的 AI 改写内容占据,读者会更难区分「原件」和「复印件」。Google 已在用 AI Overview 取代部分搜索结果中的点击链接。Pew 今年 7 月的另一项研究显示,只有 20% 的用户认为 AI 搜索摘要「非常有用」,仅 6% 的用户表示「非常信任」。

在这样的环境下,文章提出,真正具备稀缺性的将是能够提供一手现场信息、独家数据和文件、可追溯到具体人类来源的观点与判断,以及读者愿意为之付费的编辑品味的媒体。

媒体竞争指标正在变化

从这个角度看,衡量媒体竞争力的方式也在变化。发稿数量本身不再是壁垒,AI 可以一天生成 1000 篇内容,真正的壁垒变成了「可证明的人类原创」:一篇稿件中的信息究竟来自记者采访和核实,还是来自模型生成;一项判断究竟出自有行业经验的编辑,还是由 prompt 拼接而来。

文章最后写道,在一个 35% 新网页都带有 AI 痕迹的互联网里,谁能回答清楚这些问题,谁就拥有竞争优势。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
60

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。