GPT-5.5 Instant의 환각 억제와 사실성 중심 LLM 정렬
GPT-5.5 Instant의 기본 모델 전환을 바탕으로 환각 억제, 사실성 보상, 응답 간결성, 고위험 도메인 평가 체계를 분석한다.
2026-08-14 · 최초 발행 2026-05-08
기본 모델 교체가 드러낸 품질 기준의 변화
OpenAI는 2026년 4월 23일 GPT-5.5 Instant를 공개하고, 5월 5일부터 GPT-5.3 Instant를 대신하는 ChatGPT 기본 모델로 적용했다. 롤아웃 대상은 Plus·Pro 구독자에서 시작해 Free·Go·Business·Enterprise 사용자로 순차 확대됐다.
이번 전환에서 눈에 띄는 부분은 모델 크기보다 응답의 신뢰성과 밀도다. GPT-5.5 Instant는 의료·법률·금융 분야의 고위험 프롬프트에서 허위 주장을 52.5% 줄였다. 사용자가 사실 오류로 플래그한 대화에서도 부정확한 주장이 37.3% 감소했다.
벤치마크 점수도 함께 올랐다. AIME 2025 수학 테스트에서는 GPT-5.3 Instant의 65.4점보다 높은 81.2점을 기록했고, MMMU-Pro 멀티모달 추론에서는 69.2점에서 76점으로 상승했다. 응답 길이는 30.2% 짧아졌다. 정확도를 높이면서 불필요한 출력을 줄이는 방향이 기본 모델의 품질 기준으로 자리 잡은 셈이다.
자세한 답변이 사실적인 답변은 아니다
기존 RLHF(Reinforcement Learning from Human Feedback)는 인간 평가자의 선호를 학습한다. 문제는 평가자가 길고 자세하며 자신감 있게 작성된 응답을 더 좋은 답으로 판단할 수 있다는 점이다. 근거가 약한 추측이 신중하고 정확한 응답보다 높은 점수를 받으면, 보상 모델은 사실성보다 그럴듯함을 강화하게 된다.
GPT-5.5 Instant의 정렬 파이프라인에 적용된 Fact-RLHF는 이 문제를 사실성 특화 선호 데이터로 다룬다. 일반적인 선호만 수집하지 않고, 정확성과 증거 기반 추론을 중심으로 응답을 평가해 보상 모델을 훈련한다. 포함성과 자세함에 치우쳤던 평가 기준을 사실성 쪽으로 옮긴 것이다.
이 접근법은 사실성 평가 벤치마크의 정확도를 기준선 약 87%에서 약 96%로 높인 것으로 보고됐다. 사실을 확인할 수 없는 상황에서는 “모른다”고 답하는 행위에 대한 패널티를 없애고, 불확실성을 적절히 드러내는 응답을 장려하도록 보상 함수도 조정했다.
불확실성을 보상 함수에 반영하는 법
GPT-5.5 Instant의 정렬에는 Rewarding Doubt(2025) 접근법에서 발전한 불확실성 인식 RLHF 변형이 핵심적으로 적용됐다. 신뢰도 교정(confidence calibration)을 강화 학습 루프에 넣어, 장황하지만 근거가 없는 답변보다 증거에 기반한 신중한 답변에 높은 점수를 부여한다.
보상 모델은 주장에 출처나 근거 추론이 있는지를 평가하는 증거 기반 스코어링을 사용한다. 응답의 확신 수준과 실제 근거가 어긋나면 과신 패턴으로 보고 교정 기반 페널티를 부과한다. 여기에 사실 확인이 불가능한 주장의 수와 심각도를 반영하는 환각 페널티가 병렬로 작동한다.
이 구조에서 중요한 것은 답변을 무조건 소극적으로 만드는 일이 아니다. 모델이 가진 근거의 강도와 표현하는 확신의 정도를 맞추는 것이 목적이다.
일반 평가와 전문가 검토를 함께 쓰는 이유
고위험 도메인의 선호 데이터는 일반 크라우드소싱만으로 구성하지 않는다. 일반 평가와 전문가 검토를 결합한 이중 레이어가 필요하다.
의료 응답은 임상의가 진단 관련 내용을 평가하고, 법률 해석은 변호사가 정확성을 확인한다. 금융 분야에서는 CFA·CPA 자격 보유자가 수치와 규제 준수 여부를 검토한다. 이렇게 얻은 도메인 전문가 선호 데이터는 일반 RLHF 훈련 데이터와 4:6 비율로 혼합된다. 범용 응답 능력을 유지하면서 의료·법률·금융 영역의 정확도를 높이기 위한 구성이다.
추론 깊이와 응답 길이를 함께 조절한다
Chain-of-Thought(CoT)는 추론 정확도를 높일 수 있지만, 필요하지 않은 중간 단계까지 출력하면 답변이 불필요하게 길어진다. GPT-5.5 Instant는 문제 복잡도에 맞춰 추론 깊이를 배정하는 적응형 CoT 길이 제어 메커니즘을 사용한다.
단순한 사실 확인에는 직접 응답 경로를 적용한다. 중간 복잡도의 문제에는 2-3단계 추론을 사용하고, 고복잡도 문제에만 완전한 CoT를 배정하는 3단계 라우팅 구조다. 모든 질문에 같은 추론 예산을 쓰지 않아 불필요한 thinking 토큰을 줄이면서도 필요한 추론 품질은 유지한다.
훈련 목표에는 길이 페널티도 포함됐다. 핵심 정보를 전달하는 최소 토큰 수와 실제 사용 토큰 수의 비율을 바탕으로 효율성 보상(efficiency reward)을 계산한다. 이 항은 사실성 보상과 함께 최적화되므로, 단순히 답변을 잘라내는 방식과는 다르다.
스타일 수준에서는 “물론입니다”, “좋은 질문입니다” 같은 상투적 서론과 불필요한 재진술, 과도한 면책 조항을 식별해 억제한다. 출력 형식도 사용자 의도에 맞춰 달라진다. 사실 확인은 짧은 직접 답변으로, 절차 설명은 번호 목록으로, 개념 설명은 구조화된 섹션으로, 일반 대화는 자연스러운 산문으로 구성한다. 이 포맷-의도 매핑은 마크다운 남용을 줄이고 실질적인 정보 밀도를 높인다.
고위험 도메인은 오류의 성격까지 평가해야 한다
의료·법률·금융에서 사용하는 LLM은 일반 NLP 벤치마크의 정답률만으로 품질을 판단하기 어렵다. 같은 오답이라도 실제 업무에 미치는 위험이 다르기 때문이다.
의료 분야에서는 MedQA, MedBench, BioASQ 같은 데이터셋을 활용한다. MedQA는 미국 의사면허시험을 기반으로 하며, MedBench는 임상 판단 시나리오를, BioASQ는 생물의학 질의응답을 다룬다. 단순 정답률과 별도로 약물 상호작용 오류나 금기 무시처럼 임상적으로 위험한 답변을 집계하는 임상 위험 점수가 필요하다.
법률 평가에는 LegalBench, CaseHOLD, LexGLUE가 사용된다. 각각 법률 추론 능력, 판례 보유 예측, 유럽 법률 이해를 평가하며, 법령 조항과 판례 인용의 정확성 및 규제 해석의 일관성을 함께 측정한다.
금융 분야에서는 FinQA, TAT-QA, FLUE를 활용한다. 재무 수치 추론과 표·텍스트 혼합 질의응답, 금융 언어 이해를 평가하면서 수치 계산 정확도, SEC·IFRS 규제 준수 해석, 시장 예측 관련 주의 사항의 적절성을 확인한다.
사실성·안전성·효율성을 나눠 측정한다
HalluScore는 응답에 포함된 환각 주장의 비율을 문장 단위 팩트체킹으로 산출한다. GPT-5.5 Instant는 고위험 도메인에서 이 지표를 52.5% 개선했다.
FactScore는 전체 답변을 한 덩어리로 채점하지 않고 개별 사실 단위(atomic fact)의 정확도를 측정한다. SourceAttr은 각 주장이 올바른 출처에 귀속됐는지를 평가한다.
효율성 측면의 InfoDensity는 응답 토큰 수 대비 핵심 정보 단위의 비율이다. 응답 길이가 30.2% 줄었다는 사실만으로는 품질 향상을 판단할 수 없다. GPT-5.5 Instant는 응답 길이와 InfoDensity를 함께 개선했다.
| 벤치마크 | GPT-5.3 Instant | GPT-5.5 Instant | 개선율 |
|---|---|---|---|
| AIME 2025 수학 | 65.4점 | 81.2점 | +24.2% |
| MMMU-Pro 멀티모달 | 69.2점 | 76점 | +9.8% |
| 고위험 도메인 환각 | 기준 | -52.5% | -52.5% |
| 사실 오류 플래그 대화 | 기준 | -37.3% | -37.3% |
| 평균 응답 길이 | 기준 | -30.2% | -30.2% |
사실성과 간결성을 잇는 정렬 파이프라인
LLM 정렬은 사전 훈련과 파인튜닝만으로 끝나지 않는다. GPT-5.5 Instant의 사례에서는 환각 억제, 불확실성 교정, 응답 간결성, 도메인 전문가 피드백이 하나의 연속된 체계로 연결된다.
사전 훈련에서는 고품질 출처 편향(source bias) 데이터를 이용해 기반 지식의 정확성을 높인다. 지도 파인튜닝(SFT)은 전문가가 작성한 응답을 직접 학습하는 단계다. 이후 RLHF에서 선호 데이터로 훈련한 보상 모델을 적용하고, Fact-RLHF가 사실성 특화 보상 신호를 더해 환각 억제를 강화한다. 배포 뒤에는 RLAIF(AI 피드백 강화 학습)를 이용해 개선 루프를 이어간다.
간결성은 이 흐름과 분리된 후처리가 아니다. 정확성 보상, 사실성 보상, 간결성 보상의 가중 합산이 전체 최적화 목표를 구성한다. 어느 한 항만 극대화하면 자세하지만 부정확하거나, 짧지만 정보가 부족한 응답이 나올 수 있다.
GPT-5.5 Instant의 기본 모델 전환은 LLM 경쟁의 초점이 파라미터 수나 컨텍스트 창 크기만으로 결정되지 않음을 보여준다. 고위험 도메인의 환각을 52.5% 줄이고 응답 길이를 30.2% 단축한 결과는 사실성 정렬과 도메인별 평가 체계가 실무 품질을 좌우한다는 사례다. 앞으로의 품질 경쟁은 사실성 정렬의 정교함과 도메인 벤치마크 성과를 중심으로 전개될 것이다.
Sources
- OpenAI releases GPT-5.5 Instant, a new default model for ChatGPT | TechCrunch
- OpenAI Launches GPT-5.5 Instant as Default ChatGPT Model With Reduced Hallucinations and Deeper Memory | The AI Insider
- GPT-5.5 Instant Now Default Model in ChatGPT | Technology.org
- OpenAI updates ChatGPT Instant with GPT 5.5 | Axios
- GPT-5.5 - Wikipedia
- LLM Hallucinations in 2026: How to Understand and Tackle AI's Most Persistent Quirk | Lakera
- Fix LLM Hallucination System Architecture (2026) | AI Q&A Hub
- LLM Alignment, Hallucination & Misinformation | Kore.ai