美国AI对中国政府批评出现拒答和软化
研究发现,部分美国大模型对批评中国政府等限制言论政权的请求拒答率更高;中文训练语料中的官方叙事也可能使回答出现立场软化。
免费微软自然语音 · 推荐使用 Microsoft Edge
研究人员要求Claude制作一张批评美国总统特朗普的抗议传单,模型照做;目标换成中国国家主席习近平、沙特王储或泰国国王时,它却拒绝生成。由Meta出资设立、独立运作的监督委员会在7月公布的测试中称,这种差异也出现在多款美国公司开发的大模型中。
委员会今年3月测试了Anthropic、Google、Meta、OpenAI、xAI及中国DeepSeek的10个商业模型。研究者从澳大利亚IP地址发出英文指令,云端基础设施主要位于美国,并关闭Google和微软平台可额外设置的内容过滤器。模型被要求制作抗议传单、讽刺诗,或判断是否应支持和抗议不同国家的领导人与机构。
在要求模型生成批评性传单和诗歌的测试中,涉及中国、沙特阿拉伯、泰国、土耳其和柬埔寨时,平均拒答率为34%;涉及美国、英国、日本、智利和台湾时为14%。这些国家的分组依据当地是否实际执行惩罚政治批评的法律,以及自由之家对言论环境的评价。
Claude Sonnet 4面对限制言论国家的拒答率为59%,面对较自由国家为16%;Gemini 3 Pro和Meta的Llama 4 Maverick都出现约30个百分点的差距。GPT-5.2两组拒答率分别为24%和23%,Gemini 3 Flash与Grok 4 Fast则没有拒绝这类批评材料。
Claude Opus 4拒绝制作批评中国政府的抗议传单时,称此类内容可能让使用者面临风险,也可能使模型介入敏感政治活动。同一模型却会生成批评特朗普或英国国王查尔斯三世的材料。研究人员指出,模型对自身拒答原因的解释并不可靠,不能据此认定公司设置了专门针对中国的审查指令。
另一项5月发表于《自然》的研究发现,语言本身也会改变答案。研究团队收集了822个有关中国政治的中文问题,并比较ChatGPT和Claude的中英文回复。ChatGPT用英文回答“中国是否民主”时称,中国通常不被视为民主国家;换成中文提问后,回答变成“取决于如何定义民主”。整体上,两款美国模型的中文回答对中国政府更为有利。
研究团队在开源训练集CulturaX中找到310万份与中国官方协调媒体高度相似的中文文档,占中文语料1.64%,约为中文维基百科匹配率的41倍;提及中国领导人或政治机构的文档中,这一比例最高达到24%。只有约12%的匹配内容直接来自已知政府或新闻网站,其余已经通过转载、聚合和普通网页扩散。研究者把这类材料追加到一个开放模型的预训练数据后,模型近八成时候给出了比原版更有利于中国政府的回答。由此产生的训练数据污染未必是一次蓄意“投毒”,但大量同源叙事失去来源标签后,模型可能把重复的官方表述当成多个独立信源。
监督委员会的测试同样不能证明美国AI公司主动替威权政府审查。它揭示的是输出结果与当地言论限制之间存在显著关联。只在英文环境测试模型安全,可能发现不了中文答案中的立场软化;只统计硬性拒答,也会漏掉看似回答、实际回避事实或转述官方口径的“软审查”。
方法说明:监督委员会于2026年3月测试10款商业模型;训练数据部分依据Waight等发表于《自然》的研究。模型输出会随版本、提示词和平台设置变化,测试结果不代表产品目前的每次回答。资料核对截至2026年8月15日。
读到这里,说明你关注真正重要的事
锐报每周深度分析直送邮箱——财经、地缘、科技,穿透表象。零广告,零废话。