维基媒体基金会庆祝维基百科创立25周年,明确对外释放信号:全球最大的线上百科全书不只是“免费被使用”的知识库。它与多家AI巨头签订内容授权协议,正式进入商业谈判桌。维基百科目前拥有逾6500万篇条目、覆盖300多种语言,月浏览量接近150亿次,是全球前十流量网站中唯一由非营利组织运营的平台,也是大型语言模型最看重的开放数据集之一。
AI巨头不再白拿,授权合作成新常态
随着生成式AI兴起,科技公司对维基百科内容的依赖急速膨胀。为回应需求并维持财务可持续,维基媒体开发了商业产品Wikimedia Enterprise。基金会在最新声明中披露:Ecosia、Microsoft、Mistral AI、Perplexity、Pleias、ProRata等公司已加入原有合作���伴行列——包括Amazon、Google、Meta。过去习惯直接抓取维基内容用于搜索或AI训练的企业,如今以“授权合作”方式存取数据。Wikimedia Enterprise根据企业的延迟、稳定性与数据格式需求提供API或数据流,企业付费回馈维基媒体基金会,用于支撑非营利运营与基础设施建设投资。
谈判筹码:最高质量开放数据集
维基媒体强调,维基百科被多方评估为LLM训练中“最高质量”的开放数据集之一。理由在于:约25万名活跃志愿者编辑维护内容,遵循中立性、可查证与可靠来源等严格标准,经过长期版本历史与社区审查。这些结构性的知识资产,模型开发者难以自行重建。对AI公司而言,获取维基内容既关乎授权合法性与道德压力,也直接影响模型输出质量与事实掌握能力。对维基媒体来说,这相当于把被动被抓取的流量,转化为可预期的收入,以维持服务器、跨语言社区与技术开发的长期投入。
人类编辑优先,AI仅作辅助
尽管与多家AI巨头建立内容授权,维基媒体在自身AI策略中依然反复强调“人类优先”。基金会计划将AI用于检测破坏性编辑、标记可能有问题的条目、协助翻译与内容发掘,让志��者编辑可以集中精力在解读来源、写作与社区治理上。首席执行官Maryana Iskander表示,维基百科的核心价值在于“人类驱动”的知识生产,即便在AI时代,平台仍会维持全球志愿者社区治理的架构。AI工具只是降低参与门槛的辅助,而非接管内容决策的主体。

