Grokipedia vs Wikipedia:连 Grok 自己都承认,LLM 写的百科全书更不中立
> 论文:Grokipedia vs Wikipedia: An LLM-Based Audit of Political Neutrality along Ideologies > arXiv: 2607.15146 > 作者:Filippos Vlahos, Guillaume Bied, Tijl De Bie(Ghent University)
一个尴尬的开局
2025 年 10 月,xAI 上线了 Grokipedia——一个完全由 Grok 大模型生成的在线百科全书。上线时它带着一个响亮的使命:做维基百科的”中立替代品”。马斯克曾多次公开称维基百科为”Wokepedia”(觉醒派百科),是”传统媒体宣传机器的延伸”。言下之意:让 LLM 来写,没有人类编辑的偏见,总该更中立吧?
这篇来自根特大学的论文做了迄今最大规模的对比审计:1394 对政治人物传记,9 个意识形态维度,4 个 LLM 评委(Grok、Claude、Mistral、DeepSeek)。结论一句话就能说完——
所有 LLM 评委,包括 Grok 自己,都认为 Grokipedia 比 Wikipedia 更不中立。
这不是 Wikipedia 的水军写的论文,这是四个 LLM 互相打分的结果。Grok 给自己孩子打的分,比别人给它打的还低。
实验是怎么做的
数据集
研究团队从 WhoGov 数据库(2016-2023 年各国政府成员)中提取了一份政治人物名单,然后在 Wikipedia 和 Grokipedia V0.2 上分别抓取这些人物的词条。最终得到 1394 对文章——同一个人物,两个来源,各一篇。
这些人物被映射到 V-Party 数据集的 9 个意识形态维度上:经济左右翼、政治多元主义、LGBT 权利、女性劳动权利、移民、文化包容性、反民粹主义等。每个维度都有专家编码的连续分数,不是拍脑袋定的。
评委团
四个 LLM 评委:Grok(Grokipedia 的作者)、Claude、Mistral、DeepSeek。每个评委对每篇文章做中立性评估,投票为”中立””偏正面””偏负面”。
用四个评委而不是一个,是因为单个 LLM 评委自己也可能有偏见。用四个不同来源的模型,可以部分分离”文章的偏见”和”评委的偏见”。
分析方法
两种 OLS 回归:
1. 差异回归:Wikipedia 和 Grokipedia 的中立性评分之差,用意识形态维度做预测变量。正系数意味着 Wikipedia 对该意识形态更偏正面。 2. 分源回归:分别对两个来源做回归,看各自的意识形态偏向模式。
数字说了什么
1. Grokipedia 被判”有偏见”的比例更高
39% 的 Grokipedia 文章被标记为”有偏见”,Wikipedia 是 29.7%。差距近 10 个百分点。
2. 所有评委都给 Grokipedia 打更低的中立分
| 评委 | Grokipedia 偏见分 | Wikipedia 偏见分 | 差值 |
|---|---|---|---|
| Claude | 0.9455 | 0.7066 | 0.239 |
| Grok | 0.4240 | 0.3831 | 0.041 |
| Mistral | 0.2841 | 0.1915 | 0.093 |
| DeepSeek | 0.2030 | 0.1270 | 0.076 |
分数越低越中立。所有差值都为正,意味着所有评委都认为 Grokipedia 更偏颇。Claude 最严厉(差值 0.239),Grok 最温和(差值 0.041)——毕竟是自己的孩子,下手轻了点,但方向一致。
3. 偏见的方向不同
这才是最有意思的部分。两个百科全书都有偏见,但偏向不同方向:
– Grokipedia:明显偏向经济右翼人物(β = 0.221,最强预测变量),同时偏袒政治多元主义支持者;对 LGBT 权利支持者(β = -0.095)、女性劳动权利支持者(β = -0.050)、反民粹主义者(β = -0.066)和文化包容性支持者(β = -0.047)则更负面。 – Wikipedia:偏向 LGBT 权利支持者(β = 0.077)和移民支持者(β = 0.036),对经济右翼没有明显偏袒。
意识形态维度对 Grokipedia 中立性评分的解释力(R² = 0.220)是 Wikipedia 的近 4 倍(R² = 0.059)。换句话说,Grokipedia 的偏见更”结构化”——它系统性地沿着某些意识形态轴线偏移,而 Wikipedia 的偏见更零散。
4. 评委之间的一致性
四个评委的完全一致率只有 23.96%,但相邻评分(±1 分)的一致率达 88.24%。Krippendorff’s α = 0.403,属于”中等到公平”水平。
关键发现:评委们在方向上基本一致(都说 Grokipedia 更偏),但在严格程度上差异很大。Claude 是最严的评委(只有 25% 文章被判中立),DeepSeek 最宽松(86.9% 判中立)。
为什么会这样
论文没有给出确定的因果解释,但几个线索值得注意:
1. Grokipedia 是 Wikipedia 的”合成衍生物”
此前研究已经发现,Grokipedia 在内容上是 Wikipedia 的”合成衍生物”(synthetic derivative)——它大量参考 Wikipedia,但文章更长(V0.1 平均 15500 词 vs V0.2 的 6500 词),引用质量更差。在政治和争议性话题上,Grokipedia 与 Wikipedia 的分歧最大。
这意味着 Grokipedia 不是”从零写起”的独立知识库,而是 LLM 对 Wikipedia 内容的”再加工”。再加工过程中,Grok 的训练数据偏好被注入了。
2. LLM 不是空白 slate
Grok 的训练数据本身就有意识形态偏向。2026 年 Buyl 等人的研究(Large language models reflect the ideology of their creators)已经表明,LLM 会反映其创建者的意识形态。Grok 的训练数据选择、RLHF 标注者的偏好、xAI 的对齐策略——这些都会影响输出。
让一个有立场的 LLM 去”中立地”重写百科全书,就像让一个有党派倾向的编辑去”客观地”改写新闻稿——即使他努力克制,措辞的微妙差异也会泄露立场。
3. “中立”不等于”无偏见”
论文揭示了一个深层问题:“中立”是一个被争夺的概念。当马斯克说 Wikipedia”不中立”时,他指的是 Wikipedia 偏向 socially liberal;当 Grokipedia 试图”纠正”这种偏向时,它不是变得更中立,而是偏向了另一边。
真正的中立需要平衡所有意识形态维度,但 LLM 的训练过程没有这样的显式约束。它只是学会了”生成看起来合理的百科文本”,而”合理”本身就是一个有立场的概念。
这意味着什么
对 LLM 生成内容的警示
Grokipedia 不是个例。任何组织只要有足够的算力,都可以用 LLM 快速生成一个”百科全书”——政府可以、公司可以、任何有议程的实体都可以。论文指出:
> “with enough compute and resources, governments, companies or other actors can rapidly create and distribute extensive knowledge bases, with the risk of such initiatives being used to embed and promote particular ideologies.”
这意味着我们需要规模化的偏见审计方法。这篇论文的方法论——多 LLM 评委 + 专家编码的意识形态维度 + OLS 回归——就是一个可复用的框架。
对 LLM 评委的警示
四个评委的严格程度差异巨大(Claude 25% 判中立 vs DeepSeek 86.9% 判中立)。这意味着:
1. 单个 LLM 评委的判断不可信 2. LLM 评委的”偏见”和被评估内容的”偏见”纠缠在一起 3. 需要用多个不同来源的 LLM 评委来部分解耦
对”LLM 替代人类编辑”叙事的冷水
这篇论文是对”LLM 可以替代人类编辑”叙事的一盆冷水。人类编辑的偏见来自编辑群体的构成(西方、年轻、白人、男性为主),可以被多元化和透明化流程纠正。LLM 的偏见来自训练数据和对齐过程,是不透明的、难以调试的。
Grokipedia 的案例表明,LLM 生成的内容不是”更中立”,而是” differently biased”——偏见换了方向,但没有消失。
局限性
论文自身承认的局限:
1. 中立性的操作化:用 LLM 评委判断”中立性”本身就有循环论证的风险——用 LLM 判断 LLM 的偏见。 2. V-Party 数据集的覆盖:9 个维度不能穷尽所有意识形态轴线。 3. 文章选择偏差:只分析了政府成员的传记,不能代表百科全书的全貌。 4. Grokipedia V0.2:这是 beta 版本,后续版本可能不同。
结语
Grokipedia 的故事是一个关于”技术中立性幻觉”的寓言。我们倾向于认为,让机器来做决定会更客观——没有情感、没有利益、没有偏见。但机器学的数据是人类产生的,机器优化的目标是人类定义的,机器输出的”中立”是人类语言中的一个概念,本身就承载着意识形态。
Grok 给 Grokipedia 打的中立分比自己给 Wikipedia 打的还低。这不是因为 Grok 有自我批评的能力,而是因为 Grokipedia 的偏见太明显了,连产生它的模型都能在评委角色中检测到。
这可能是这篇论文最值得记住的细节:偏见大到一定程度,连偏见本身都能看见它。
—
论文链接:https://arxiv.org/abs/2607.15146 HTML 版本:https://arxiv.org/html/2607.15146v1 数据集:WhoGov + V-Party
