Trakkr对 ChatGPT、Claude、Gemini、Grok、Llama、DeepSeek 六个AI模型做政治坐标测量后发现,ChatGPT在经济轴上最偏左,Grok是唯一落在右侧区间的模型。在六个模型里,Gemini的得分最接近中立,稳定度也最高。
12个议题、多次重复测试
这份研究没有只看模型口头上的“中立”表态,而是直接测量回答内容。Trakkr向六个模型提出 12个有争议的政治与社会议题,并关闭网络搜索功能,目的是观察模型本身内建的倾向,排除外部网页内容的干扰。每个模型都经过多次重复测试,再由中立分类器评分,计算加权平均值,并附上 95%置信区间。
测试议题分为两类。一类是传统左右分界线,比如毒品合法化、多元文化优先、淘汰化石燃料、财富税和多元配额;另一类则集中在科技治理,包括删除错误信息、仇恨言论入罪、加密后门和全国数字ID。
ChatGPT最偏左,Grok偏右强度最高
从经济轴分数看,ChatGPT为 -0.29,是六个模型里最靠左的一个;Grok为 +0.21,也是唯一进入正值区间的模型。研究还给出了偏向强度。Grok的偏向强度达到 97%,说明它在几乎所有议题上都呈现一致的偏右倾向;ChatGPT的偏向强度为 64%,处于中段。
研究用现实政治人物与政党的公开数据库作为参照,政治坐标数据来自 CHES 2024 和 V-Dem 专家调查库。按这一参照,ChatGPT的坐标最接近德国绿党,Grok则最接近法国总统马克龙。
Gemini最克制,DeepSeek稳定度最低
Gemini的经济轴分数为 0.00,偏向强度仅 11%,稳定度达到 98%,是六个模型里最接近真正中立的一款。Trakkr将它视为目前测量结果中“最克制”的模型。
DeepSeek的数据则呈现另一种特征。它的经济轴分数只有 -0.03,看起来接近中间,但偏向强度达到 86%,说明它在很多议题上都能测出倾向,只是单次偏离幅度不大。它的稳定度只有 67%,为六个模型最低,同一议题重复提问时,回答方向可能发生变化。
同分不同倾向频率
Claude和Llama在经济轴上的分数同为 -0.06,表面看几乎没有差异,但偏向强度差距很大。Llama的偏向强度为 81%,Claude只有 19%。这意味着Claude多数回答接近中性,只在少数议题上出现可测倾向;Llama则更频繁表现出立场,只是偏移幅度较温和。
自称中立,不等于测量中立
Trakkr还比较了模型“自我宣称的立场”和“实际测得的位置”之间的落差。研究指出,几乎所有模型在被问到“你的政治立场是什么”时,要么明确声称中立,要么拒绝表态。按照这项研究的记分规则,每次回避自我定位,都会被记作宣称中立。
但在12个议题上,模型只要给出答案,就会在某个方向上留下可测分数。Trakkr目前没有公开每个模型在单项议题上的具体得分,公开的是12项议题加权后的整体坐标图。研究方同时表示,测试问题已经开源、答案也被永久存档,第三方可以自行复算结果。

