一项针对主流大模型(LLM)的政治光谱测试引发了Hacker News社区的激烈讨论。实验者让Claude、Gemini、DeepSeek以及Grok等主流模型完成了著名的“政治指南针”测试(Political Compass Test),每种模型进行了70次测试(包含原始问题、极性翻转问题及乱序问题)。结果显示,所有模型无一例外地落入了“自由左派”(Libertarian-Left)象限。甚至连埃隆·马斯克旗下试图打造反“觉醒”立场的Grok模型,在测试中也表现出明显的左倾倾向,且呈现出双峰分布特征:一方面与主流模型趋同,另一方面表现出一定的右翼特征,这被分析为系统提示词与底层预训练权重之间的拉锯战。
评论区对该现象的成因进行了深入剖析。主流观点认为,这种偏见主要源于预训练数据的构成,而非单纯的后训练对齐(RLHF)。过去10-15年间,美国学术界、企业界及主流媒体产出的文本材料普遍具有自由派倾向,大模型在拟合这些数据时自然习得了这一特征。此外,有开发者指出,所谓的“左派”观点(如承认气候变化、支持可再生能源)在很多国家是客观常识,仅在美国两党极化的语境下才被视为“左派”。这暴露了用美国中心主义的二元政治光谱来衡量通用智能模型的局限性。同时,也有观点指出,互联网文本主要反映了受过良好教育的“知识阶层”的价值观,而非整个人类社会的全貌。
事件分析
从技术角度看,Grok的“双峰分布”证明了仅靠系统提示词或微调难以完全扭转预训练阶段建立起来的深层偏好。当基础语料库存在系统性倾斜时,模型会通过无监督学习内化这些意识形态,后续的RLHF虽然在安全护栏上有效,但在深层政治立场上难以撼动底层概率分布。这也解释了为什么即使是DeepSeek等非美国背景模型,在训练于类似的英文/高质量语料时,也会表现出相似的倾向。这表明,要实现真正“中立”或符合特定文化需求的模型,可能需要从底层数据清洗和区域性语料构建入手,而非仅仅依赖后期的对齐技术。
💡 核心观点:大模型的政治倾向并非刻意设限,而是全球互联网文本语料中“知识精英阶层”意识形态的客观映射。
原文链接:Hacker News

评论前必须登录!
立即登录 注册