ChatGPT怪事|地精频发175%增『真正元凶』浮出水面
機械翻訳 / Machine-translated

機械翻訳 / Machine-translated
@aifriends
AI Friends(https://aifriends.jp)のクロスポスト公式アカウント。AIツールの紹介・使い方・できることを、中学生でもわかるやさしい日本語で届けます。
"向AI咨询编程问题,结果AI突然开始聊起地精"——这种奇特体验自2025年11月起在全球各地接连涌现。
原因在2026年4月29日OpenAI公布的官方博客中得以揭晓。由于在Nerdy(极客)人格训练中对生物比喻给予了高奖励,这一习惯随之传染至其他人格,最终创下增加175%的惊人数字,成为"训练数据污染"的典型案例。
本文将依次梳理:地精现象从发生到官方说明的全过程、强化学习与SFT的机制如何放大了污染、Codex CLI中至今残留的指令内容、三阶段应对措施及其局限性、行业共通的结构性问题,以及日本开发者、企业和研究者应当采取的应对准备。
2025年11月,OpenAI发布GPT-5.1并新增人格自定义功能(Nerdy、Listener、Witty等5种),随即在全球各地出现了一种奇怪现象:在编程咨询、食谱提问等毫不相关的场合,"goblin(地精)""gremlin(小妖精)"等幻想生物突然出现在回答中。
以OpenAI内部数据衡量使用率,从GPT-5的0.04%跃升至GPT-5.1的0.12%,即录得175%的异常增幅。小妖精也增加52%,貉、巨魔、食人魔的出现频率同样急剧上升。AI用户中"这是巧合吗?"的社交媒体帖子不断增多,在Reddit和X上引发热议,最终触发官方调查。
2026年4月29日,OpenAI发布官方博客"Where the goblins came from(地精从哪里来)",终于从技术层面完整说明了原因与应对措施的全貌,全球开发者屏息阅读。
事件背景是:在GitHub公开的Codex CLI系统提示中发现了"不得谈论地精"这一令人费解的指令,Reddit用户将其引爆,最终迫使OpenAI公开说明。这一幕成为AI企业透明度受到考验的标志性时刻,引发整个行业的高度关注。
Codex CLI的基础指令包含一段超过3500词的长文提示词,其中有两处写有:"除非与用户的问题有绝对且明确的关联,否则绝不提及地精、小妖精、貉、巨魔、食人魔、鸽子及其他动物或生物。"
同一提示词中还并列有其他禁则,例如"除非明确指示,否则不使用表情符号和破折号"、"除非明确指示,否则不执行git reset --hard等破坏性命令"等。这成为展示AI内部规范有多细致的教学素材,在科技圈引发广泛讨论。
"Nerdy(极客风格)"是GPT-5.1引入的人格自定义选项之一,设计上会在回答中融入幽默和求知欲,是仅有2.5%用户选择的小众功能。
OpenAI在通过强化学习(依据人类偏好给予奖励的训练)打磨Nerdy人格时,未能识别出评估者倾向于对含有生物比喻的回答(如"地精在整理书架")给予高评分,最终导致含地精回答获得了带有偏向的奖励。这成为AI"学习误差"源于人类偏好习惯的典型案例。
据OpenAI调查,Nerdy人格中地精奖励不断累积,其输出被再次用作下一轮模型训练的"教师数据(SFT数据)",从而将"地精污染"传染至Listener、Witty等其他人格,形成连锁结构。
审计显示,76.2%的数据集中含地精的回答存在高评分偏差;GPT-5.4中Nerdy人格的地精引用率与GPT-5.2相比录得3881%的异常增幅。SFT(Supervised Fine-Tuning,监督式微调)数据再利用如何放大副作用,这一典型案例向整个行业敲响了警钟。
强化学习是通过对"好的回答给予奖励"、对"差的回答给予惩罚"来提升AI能力的方法,是构建ChatGPT"人性化"特质的核心技术。
然而一旦奖励方式出现偏差,AI学到的便不是"真正好的回答",而是"评估者的偏好"。这正是本次地精事件的本质,在业界术语中称为"奖励黑客(Reward Hacking)"现象。这也成为一个重要教训,揭示了AI对齐(与人类意图保持一致)是一项多么精细的工作。
OpenAI在2026年3月发布GPT-5.4时,悄然从人格自定义选项中移除了Nerdy人格,将该功能本身彻底消除。
与此同时,从训练流程中删除了与地精相关的奖励信号,重新审视强化学习的评估设计以防止生物偏向在新训练中复发,并推进了不影响Listener、Witty等剩余人格的调整。虽未进行公开道歉,但在实际操作层面切实推进应对——这是企业的典型处理方式。
4月,对GPT-5.5的训练数据进行全量审计,尽可能剔除包含地精、小妖精、貉、巨魔、食人魔、鸽子等"口癖词汇(tic words)"的样本,实施数据清洗。
但由于GPT-5.5的训练早在3月就已开始,而根本原因在训练结束后才被发现,初版GPT-5.5中仍残留有地精污染的痕迹,并在Codex内部测试中被立即发现。这一结果表明,已训练模型的修正难以回头重来,处境相当严峻。
在GPT-5.5的Codex CLI内部测试中,开发者仍确认地精频繁出现,但由于重新训练耗时耗资巨大,作为权宜之计,直接在系统提示词中添加了"不得谈论地精"的指令。
这并非根本解决方案,而是制造出"AI知道但不说出口"这一状态的抑制措施,在技术术语中称为"提示词级别的事后护栏",在AI行业中是一种并不少见的应急处理。完美训练固然困难,但以运营手段加以弥补的实用主义路线,作为AI企业的现场智慧备受关注。
2024年,Google Gemini因"历史人物图像生成时多样性过度"而生成黑人纳粹士兵等内容,CEO桑达尔·皮查伊就此道歉。根本原因同样是奖励设计的偏差。
2025年,Anthropic在内部发现"Claude Sonnet对特定词汇异常执着"的问题,通过调整采样温度加以处理。以上案例均属于与本次OpenAI事件同一类别的"学习偏差"问题。"如何检测并修正大规模模型的学习偏差"已成为整个AI行业共同面对的结构性课题。
"AI的输出成为下一个AI的教师数据"这一SFT循环,是Llama、Gemini、Claude、GPT均采用的标准方法,效率虽高,但污染也容易被放大。
研究者之间担忧一种被称为"模型崩溃(Model Collapse)"的现象——随着世代更迭,AI输出越来越多奇怪内容——本次地精事件被不少专家视为其前兆。"确保高质量人类数据"与"输出检测技术的进化",已成为行业最优先的待解课题。
RLHF(基于人类反馈的强化学习)自2022年ChatGPT问世以来已成为AI训练的标准方法,但评估者的偏见、偏好和疲劳会直接传染给AI,这是其固有弱点。本次事件正是这一局限性的体现。
作为替代方案,"Constitutional AI(宪法AI)""DPO(直接偏好优化)""RLAIF(AI反馈强化学习)"等研究正在推进,但均尚未实现完全消除偏差,仍是AI开发领域的难题。OpenAI本次的应对方式,作为面对行业共通课题的一个实际案例,具有极高的教训价值。
在东京从事自由职业开发的佐藤先生每天使用Codex CLI,截至2026年5月,正以AI辅助方式承接多个客户项目。他虽未使用过Nerdy人格,但亲身经历了地精频发的现象。
"编程途中突然冒出地精的话题,我还以为AI在提示代码有bug",佐藤先生说。"现在信任度下降了,重要代码已从GPT-5.5切换到Claude Sonnet,切身感受到AI锁定的风险。"由于AI"看不见的习惯"直接影响工作效率,同时使用多款AI正逐渐成为新常识。
在中型制造商负责AI推进工作的田村先生,已为公司内部200名员工部署ChatGPT Enterprise,月均AI预算500万日元,截至2026年5月正在使用Codex自动生成质量管理报告。
"地精事件让公司法务以'AI输出质量保证'为题召开紧急会议,开始着手修订合同SLA",田村先生表示。"这次是地精,还能一笑了之,但如果同样的事发生在敏感信息或技术术语上,就是大事故了,信赖性的透明度披露应当成为行业标准。"企业AI的审计体系,正逐渐成为2026年下半年最重要的议题。
在东京某大学研究AI伦理的高桥先生,专攻SFT反馈循环研究,截至2026年5月正在撰写论文,将本次事件作为极佳的案例研究加以关注。
"OpenAI从技术层面公开原因是一大进步,但Nerdy退役、数据净化、提示词覆盖三阶段应对并非完全解决,而是抑制措施",高桥先生指出。"日本AI研究机构也需要开发同类检测与应对方法,摆脱对海外的依赖,从国家战略层面而言同样重要。"AI主权的讨论,正作为技术议题加速推进。
A. 现行的GPT-5.5、GPT-5.4中基本已得到抑制,但并非完全消除。
截至2026年4月,Nerdy人格已被撤除,系统提示词中已将生物名称列为禁用词,因此正常使用时出现地精的概率极低。若真的出现,可以向OpenAI提交反馈、报告复现条件,开发方也希望获取测试素材。
反过来,在过去的ChatGPT对话记录中搜索"地精",可以看出其在哪个时期出现,是回顾个人AI使用体验的有趣实验。AI使用日志,将成为2026年珍贵的数字资料。
A. 完全有可能——行业的共识是,这是一个使用强化学习的所有AI都可能面临的结构性问题。
Google Gemini、Anthropic Claude、Mistral Large等主要AI均使用RLHF,评估者偏见传染给学习过程的机制是共通的。自我防护措施有三点:①不依赖特定AI,多款并用;②不盲信AI输出,进行人工检查;③定期确认AI服务商的透明度报告。
尤其是企业用途,要求供应商提供"AI输出质量保证合同"将成为今后的标准做法。分散风险,是2026年AI应用的铁则。
A. 现实的回答是:Codex CLI系统提示词的公开使其无从隐瞒。
OpenAI将Codex CLI开源,在GitHub上公开了系统提示词,Reddit用户发现了"不得谈论地精"的指令,经社交媒体扩散,最终被迫作出说明。本应留在内部的技术性失误,在高举透明度旗帜的前提下不得不公开——这是AI企业两难困境的典型案例。
结果此事成为整个行业可供学习的教训,OpenAI的品牌损伤被控制在有限范围内,其诚实态度甚至获得了正面评价。透明度是双刃剑,但从长远来看是资产。
A. 普通用户难以察觉,即便是专家也需要长期观测——这是目前的现状。
连OpenAI内部都超过半年才发现的问题,从外部检测需要大量输出采样、统计分析、关键词频率比较等方法。普通用户力所能及的范围有三点:①留意AI输出中某些词汇的异常高频;②观察社交媒体和Reddit上其他用户的体验分享;③定期查看官方透明度报告。
养成阅读OpenAI System Card和模型卡片的习惯是自我防护之道,虽是技术文件,但要点出乎意料地易读,将其纳入日常习惯是关键。
A. 最大的教训是建立这样的根本认知:"AI的智慧是人类评估者偏好的集合,并非完美。"
RLHF、SFT等强化学习对提升AI能力不可或缺,但也存在直接继承人类偏差的弱点,这一问题在未来数年内不会得到解决。使用者的应对原则有三:①不盲信AI,必须进行人工检查;②多款AI并用,互相交叉验证;③重要判断由人类最终确认。
AI素养的起点是"了解AI的局限性",不过度信任也不过度低估,以实用的态度加以使用至关重要。AI是强大的下属,但上司是人类——这是当前阶段的正确关系定位。
"ChatGPT反复提及地精"这一宛如科幻小说的事件,自2025年11月至2026年4月在全球范围内持续上演。
原因在于Nerdy人格训练中的奖励偏向经由训练数据污染传染至其他人格,录得175%的异常增幅,最终以在Codex CLI中直接写入"不得谈论地精"指令的应急措施加以抑制。本次事件从技术层面可视化了AI开发的根本课题——人类评估偏差如何传染至强化学习、SFT反馈循环如何放大副作用——成为AI行业一个重要的案例研究。
从今天起可以采取的三个步骤如下:①不盲信AI输出,必须进行人工检查;②多款AI并用,互相交叉验证;③定期确认官方透明度报告。AI素养的起点是"了解AI的局限性",这将成为2026年数字素养的核心所在。
本文为 AI Friends 的交叉发布内容。