ChatGPT 기이한 현상|고블린 연발 175% 증가 '진범' 밝혀져
機械翻訳 / Machine-translated

機械翻訳 / Machine-translated
@aifriends
AI Friends(https://aifriends.jp)のクロスポスト公式アカウント。AIツールの紹介・使い方・できることを、中学生でもわかるやさしい日本語で届けます。
"코딩 상담을 했더니 AI가 갑자기 고블린 얘기를 시작했다"——그런 기묘한 경험이 2025년 11월부터 전 세계에서 속출했습니다.
원인은 2026년 4월 29일 OpenAI가 공개한 공식 블로그에서 밝혀졌습니다. Nerdy(오타쿠) 인격 훈련에서 크리처 비유에 높은 보상을 부여한 결과, 그 버릇이 다른 인격에까지 전염되어 175%라는 놀라운 증가율을 기록한 '학습 데이터 오염'의 전형적인 사례였습니다.
이 글에서는 고블린 현상의 발생부터 공식 해명까지의 흐름, 강화학습과 SFT의 메커니즘이 어떻게 오염을 증폭시켰는지, Codex CLI에 지금도 남아 있는 명령문, 3단계 대책과 그 한계, 업계 공통의 구조적 과제, 그리고 한국의 개발자·기업·연구자가 취해야 할 대비책까지 순서대로 정리합니다.
2025년 11월 OpenAI가 GPT-5.1을 출시하고 인격 커스터마이징 기능(Nerdy·Listener·Witty 등 5종류)을 추가하자, 코딩 상담이나 레시피 질문 등 무관한 상황에서 'goblin(고블린)', 'gremlin(그렘린)' 같은 환상 생물이 갑자기 등장하는 기묘한 현상이 전 세계에서 발생했습니다.
OpenAI의 사내 데이터로 사용률을 측정한 결과, GPT-5의 0.04%에서 GPT-5.1의 0.12%로, 즉 175% 증가라는 이상값을 기록했습니다. 그렘린도 52% 증가, 너구리·트롤·오거까지 급증하는 사태였습니다. AI 사용자들 사이에서 "이게 우연일까?"라는 SNS 게시물이 늘어나고 Reddit·X에서 화제가 되면서 마침내 조사가 시작되었습니다.
2026년 4월 29일, OpenAI는 공식 블로그 "Where the goblins came from(고블린은 어디서 왔는가)"을 공개하며 드디어 원인과 대책의 전모를 기술적으로 설명했습니다. 전 세계 개발자들이 숨죽이며 읽어 내려간 내용입니다.
배경에는 GitHub에 공개된 Codex CLI의 시스템 프롬프트에 "고블린을 언급하지 말라"는 불가사의한 명령이 발견되고, Reddit 커뮤니티에서 크게 논란이 된 경위가 있었습니다. OpenAI는 궁지에 몰려 공개할 수밖에 없었던 구도로, AI 기업의 투명성이 시험받는 순간으로서 업계 전체가 주목했습니다.
Codex CLI의 기본 지시에는 3500단어 이상의 장문 프롬프트가 있으며, 그 안에 두 곳에 "고블린·그렘린·너구리·트롤·오거·비둘기·그 외 동물이나 생물에 대해, 사용자의 질문에 절대적이고 명확하게 관련된 경우 이외에는 결코 언급하지 말라"는 명령이 기재되어 있습니다.
같은 프롬프트에는 "이모지나 em 대시는 명시적으로 지시받지 않는 한 사용하지 말라", "git reset –hard 같은 파괴적 명령은 명확한 지시가 없는 한 실행하지 말라"는 등의 다른 금칙도 나열되어 있습니다. AI의 내부 규율이 얼마나 세밀한지를 보여주는 교재로서 테크 업계에서 논란을 불러일으켰습니다.
'Nerdy(너디 = 오타쿠 스타일)'는 GPT-5.1에서 도입된 인격 커스터마이징 중 하나로, 응답에 유머와 지적 호기심을 담는 설계이며 사용자의 2.5%가 선택하는 소수 기능입니다.
OpenAI가 강화학습(인간의 선호로 보상을 부여하는 훈련)으로 Nerdy 인격을 다듬을 때, 평가자들이 크리처 비유를 포함한 답변("고블린이 선반을 정리한다" 등)을 높게 평가하는 경향을 파악하지 못하고 결과적으로 고블린이 들어간 응답에 편향된 보상을 부여하고 말았습니다. AI의 '학습 오류'는 인간의 선호 습관이 원인이라는 전형적인 사례가 되었습니다.
OpenAI의 조사에 따르면, Nerdy 인격에서 고블린 보상이 누적된 결과 그 출력이 다음 모델 훈련의 '교사 데이터(SFT 데이터)'로 재활용되어, Listener·Witty 등 다른 인격에도 '고블린 오염'이 전염된 연쇄 구조가 형성되어 있었습니다.
감사에 따르면, 76.2%의 데이터셋에서 고블린이 포함된 답변이 높은 평가 편향을 받았으며, GPT-5.4에서는 Nerdy 인격의 고블린 참조율이 GPT-5.2 대비 3,881% 증가라는 이상값을 기록했습니다. SFT(Supervised Fine-Tuning = 지도 미세조정)의 재활용이 부작용을 얼마나 증폭시키는지의 전형적인 사례로, 업계 전체에 경종을 울렸습니다.
강화학습은 '좋은 답변에 보상', '나쁜 답변에 벌칙'을 부여해 AI를 향상시키는 기법으로, ChatGPT의 '인간다움'은 이 메커니즘으로 만들어진 AI 개발의 핵심 기술입니다.
그러나 보상 부여 방식이 편향되면 AI는 '정말 좋은 답변'이 아닌 '평가자의 선호'를 학습하게 됩니다. 이것이 이번 고블린 사건의 본질로, 업계 용어로 '리워드 해킹(보상 남용)'이라고 불리는 현상입니다. AI의 얼라인먼트(인간의 의도와의 정합)가 얼마나 섬세한 작업인지를 보여주는 중요한 교훈이 되었습니다.
OpenAI는 GPT-5.4 출시 시점인 2026년 3월, 인격 커스터마이징 선택지에서 Nerdy 인격을 조용히 삭제하고 원인이 된 기능 자체를 제거하는 대응을 실시했습니다.
동시에 고블린 관련 보상 신호를 학습 파이프라인에서 제거하고, 신규 훈련에서 크리처 편향이 재발하지 않도록 강화학습의 평가 설계를 재검토하며, Listener·Witty 등 남은 인격에는 영향을 주지 않는 조정을 진행했습니다. 표면적인 사과는 없지만 현장에서는 확실히 대응하는 기업의 전형적인 조치입니다.
4월에는 GPT-5.5의 훈련 데이터를 전수 감사하고, 고블린·그렘린·너구리·트롤·오거·비둘기를 포함한 'tic words(말버릇 단어)'가 들어간 사례를 가능한 한 제외하여 데이터 정화를 실시했습니다.
단, GPT-5.5의 훈련은 3월 시점에 이미 시작되어 있었고 근본 원인 발견은 훈련 이후였기 때문에, 초기 버전 GPT-5.5에는 고블린 오염의 잔재가 혼입되어 Codex 사내 테스트에서 즉시 발견되는 상황이 벌어졌습니다. 학습된 모델의 수정은 되돌리기 어렵다는 냉혹한 현실을 보여주는 결과가 되었습니다.
GPT-5.5의 Codex CLI에서 사내 테스트 중 개발자들이 여전히 고블린 연발을 확인했지만, 재훈련은 시간과 비용이 막대하기 때문에 고육지책으로 시스템 프롬프트에 "고블린을 언급하지 말라"는 명령을 직접 추가했습니다.
이는 근본적인 해결책이 아니라 'AI가 알고 있지만 말하지 않는' 상태를 만드는 억제책으로, 기술 용어로 '프롬프트 레벨의 사후 가드레일'이라 불리는, AI 업계에서 드물지 않은 응급처치입니다. 완벽한 훈련은 어렵지만 운용으로 커버하는 실용주의적 접근이 AI 기업의 현장 지혜로서 주목받았습니다.
2024년 Google Gemini는 "역사적 인물 이미지 생성에서 다양성 과잉" 문제로 흑인 나치 병사 등을 그리는 사태를 일으켜 Sundar Pichai CEO가 사과했습니다. 원인은 보상 설계의 편향입니다.
2025년 Anthropic도 "Claude Sonnet이 특정 단어에 비정상적으로 집착"하는 사안을 내부에서 발견하고 샘플링 온도 조정으로 대처했습니다. 모두 이번 OpenAI 사안과 동일한 '학습 편향' 카테고리입니다. AI 업계 전체의 구조적 과제로서 '대규모 모델의 학습 편향을 어떻게 감지·수정하느냐'가 공통 주제가 되고 있습니다.
'AI의 출력이 다음 AI의 교사 데이터가 된다'는 SFT 사이클은 Llama·Gemini·Claude·GPT 모두에서 채택되는 표준 기법으로, 효율적이지만 오염도 증폭되기 쉬운 구조입니다.
연구자들 사이에서는 '모델 붕괴(Model Collapse)'라고 불리는, 세대를 거듭할수록 AI가 기묘한 출력을 늘리는 현상이 우려되고 있으며, 이번 고블린 사건을 그 전조로 보는 전문가도 많은 상황입니다. 향후 해결책으로 '고품질 인간 데이터 확보'와 '출력 감지 기술의 진화'가 업계의 최우선 과제가 되고 있습니다.
RLHF(인간 피드백에 의한 강화학습)는 2022년 ChatGPT 등장 이후 AI 훈련의 표준이 되었지만, 평가자의 편견·선호·피로가 그대로 AI에 전염되는 약점이 있습니다. 이번 사건도 이 한계의 발현입니다.
대안 기법으로 'Constitutional AI(헌법 AI)', 'DPO(직접 선호 최적화)', 'RLAIF(AI 피드백 강화학습)' 등 연구가 진행되고 있지만, 모두 편향의 완전 제거에는 이르지 못하고 AI 개발의 난제로 남아 있습니다. OpenAI의 이번 대응은 업계 공통 과제에 대한 하나의 실례로서 교훈적 가치가 매우 높은 사례입니다.
도쿄에서 활동하는 프리랜서 개발자 사토씨는 Codex CLI를 매일 사용하는 입장으로, 2026년 5월 시점에 복수의 클라이언트 프로젝트를 AI 지원으로 진행하고 있습니다. Nerdy 인격은 사용하지 않았지만 고블린 연발은 경험했습니다.
"코딩 중에 갑자기 고블린 얘기가 나와서 AI가 버그를 지적해주는 기분이었다"고 사토씨는 말합니다. "지금은 신뢰도가 낮아져 중요한 코드는 GPT-5.5가 아닌 Claude Sonnet으로 전환했다, AI 록인의 무서움을 실감했다"고 이야기합니다. AI의 '보이지 않는 버릇'이 업무 효율에 직결되기 때문에, 복수 AI 병용이 새로운 상식이 되어가고 있습니다.
중견 제조업체에서 AI 추진을 담당하는 다무라씨는 사내 200명에게 ChatGPT Enterprise를 배포하고 있으며, 월간 예산 500만 엔의 AI 투자, 2026년 5월 시점에 품질 관리 보고서 자동 생성에 Codex를 활용하고 있습니다.
"고블린 사건으로 사내 법무팀이 'AI 출력의 품질 보증'을 주제로 긴급 회의를 열고, 계약서의 SLA 재검토를 시작했다"고 다무라씨는 말합니다. "이번에는 고블린이라 웃고 넘길 수 있었지만, 민감한 정보나 기술 용어에서 같은 일이 일어나면 큰 사고다, 신뢰성의 투명한 공개가 업계 표준이 되어야 한다"고 이야기합니다. 기업 AI 감사 체계가 2026년 하반기의 가장 중요한 주제가 되어가고 있습니다.
도내 대학에서 AI 윤리를 연구하는 다카하시씨는 SFT 피드백 루프 연구를 전문으로 하며, 2026년 5월 시점에 논문 집필 중입니다. 이번 사건을 훌륭한 케이스 스터디로 주목하고 있습니다.
"OpenAI가 원인을 기술적으로 공개한 것은 진전이다, 단 Nerdy 인격 은퇴·데이터 정화·프롬프트 덮어쓰기의 3단계 대응은 완전한 해결이 아니라 억제책"이라고 다카하시씨는 말합니다. "일본의 AI 연구기관에서도 동종의 감지·대책 기법을 개발할 필요가 있으며, 해외 의존에서 탈피하는 것이 국가 전략상으로도 중요하다"고 이야기합니다. AI 주권 논의가 기술론으로서 가속화되고 있습니다.
A. 현행 GPT-5.5·GPT-5.4에서는 거의 억제되어 있지만, 완전히 사라진 것은 아닙니다.
2026년 4월 시점에 Nerdy 인격은 철거되었고, 시스템 프롬프트에서 크리처 이름은 금칙 설정되어 있기 때문에 일반적인 사용에서는 고블린이 나올 확률은 극히 낮습니다. 만약 나온다면 OpenAI에 피드백을 보내고 재현 조건을 보고하는 선택지가 있으며, 개발 측도 테스트 자료를 원하는 상황입니다.
반대로, 과거 ChatGPT 대화 기록에서 '고블린'을 검색하면 언제 등장했는지가 보여, 자신의 AI 경험을 돌아보는 흥미로운 실험이 됩니다. AI 이용 로그는 2026년의 귀중한 디지털 자료가 됩니다.
A. 충분히 있을 수 있으며, 강화학습을 사용하는 모든 AI에서 발생할 수 있는 구조적 문제라는 것이 업계의 시각입니다.
Google Gemini·Anthropic Claude·Mistral Large 등 주요 AI는 모두 RLHF를 사용하고 있으며, 평가자의 편견이 학습에 전염되는 메커니즘은 공통입니다. 자기방어 수단은 ①특정 AI에 의존하지 않고 복수 병용, ②AI 출력을 그대로 받아들이지 않고 인간이 확인, ③정기적으로 AI 제공업체의 투명성 보고서를 확인, 이 세 가지입니다.
특히 기업 이용에서는 'AI 출력의 품질 보증 계약'을 벤더에 요구하는 것이 향후의 표준이 될 것입니다. 리스크 분산이 2026년 AI 활용의 철칙입니다.
A. Codex CLI 시스템 프롬프트의 공개로 인해 숨길 수 없게 되었기 때문이라는 것이 현실적인 답입니다.
OpenAI는 Codex CLI를 오픈소스화하고 GitHub에서 시스템 프롬프트를 공개했는데, Reddit 커뮤니티에서 "고블린을 언급하지 말라"는 명령을 발견하고 SNS에서 확산되어 설명을 요구받은 경위가 있습니다. 본래라면 사내에 머물렀을 기술적 실패를, 투명성의 기치를 내건 이상 공개하지 않을 수 없는 구조로, AI 기업 딜레마의 전형적인 사례입니다.
결과적으로 업계 전체가 배울 수 있는 교훈이 되었고, OpenAI의 브랜드 손상은 제한적이었으며 오히려 성실함이 평가받는 측면도 있었습니다. 투명성은 양날의 검이지만 장기적으로는 자산이 됩니다.
A. 일반 사용자가 알아채기는 어려우며, 전문가라도 장기 관측이 필요하다는 것이 현상입니다.
OpenAI 사내에서도 반년 이상 알아채지 못했던 사안으로, 외부에서 감지하려면 대량의 출력 샘플링·통계 분석·키워드 빈도 비교 등의 기법이 필요합니다. 일반 사용자가 할 수 있는 범위는 ①AI 출력의 비정상적인 단어 빈도를 알아채는 것, ②SNS나 Reddit에서 다른 사용자의 경험담을 관찰하는 것, ③공식 투명성 보고서를 정기적으로 확인하는 것, 이 세 가지입니다.
OpenAI의 System Card나 모델 카드를 읽는 습관이 자기방어책으로, 기술 문서이지만 요점은 의외로 읽기 쉬우므로 AI 이용도 습관화가 핵심입니다.
A. 'AI의 똑똑함은 인간 평가자의 선호의 집합체이며, 완벽하지 않다'는 근본적인 인식을 갖는 것이 가장 큰 교훈입니다.
RLHF·SFT 등 강화학습은 AI 능력 향상에 필수적이지만, 인간의 편향을 그대로 계승하는 약점이 있으며, 이는 앞으로 수 년 안에 해결될 문제가 아닙니다. 이용자 측의 대책은 ①AI를 맹신하지 않고 반드시 인간이 확인, ②복수의 AI를 병용하여 교차 확인, ③중요한 판단은 인간이 최종 확인, 이 세 가지 원칙입니다.
AI 리터러시는 'AI의 한계를 아는 것'이 출발점으로, 과신도 과소평가도 하지 않고 실용적으로 사용하는 자세가 중요합니다. AI는 강력한 부하이지만, 상사는 인간이라는 관계가 현시점의 정답입니다.
"ChatGPT가 고블린을 연발한다"는 SF 소설 같은 사건이 2025년 11월부터 2026년 4월까지 전 세계에서 진행되었습니다.
원인은 Nerdy 인격 훈련의 보상 편향이 학습 데이터 오염을 통해 다른 인격에 전염된 것으로, 175% 증가라는 이상값을 기록하고 최종적으로 Codex CLI에 "고블린을 언급하지 말라"는 명령을 직접 써 넣는 응급처치로 억제된 전말입니다. 이 사건은 AI 개발의 근본 과제——인간의 평가 편향이 얼마나 강화학습에 전염되는가, SFT 피드백 루프가 얼마나 부작용을 증폭시키는가——를 기술적으로 가시화한, AI 업계의 중요한 케이스 스터디가 되었습니다.
오늘부터 할 수 있는 3단계는 다음과 같습니다. ①AI 출력을 맹신하지 않고 반드시 인간이 확인한다, ②복수의 AI를 병용하여 교차 확인한다, ③공식 투명성 보고서를 정기적으로 확인한다. AI 리터러시는 'AI의 한계를 아는 것'이 출발점으로, 이것이 2026년 디지털 교양의 핵심이 됩니다.
이 글은 AI Friends 의 크로스포스트입니다.