미해결 문제에 AI를 투입할 때 필요한 생성·검증 분리 아키텍처

정답이 없는 문제에 AI를 활용할 때 후보 생성과 기계 검증을 분리하고, 재현성·예산·이력을 관리하는 운영 아키텍처를 정리한다.

2026-09-02 · 최초 발행 2026-08-03

설득력 있는 답과 검증된 답은 다르다

OpenAI는 2026년 8월 1일 차기 대형 모델 Astra의 내부 버전이 최소 10년간 주요 진전이 없던 수학·이론전산 문제 10건의 해법을 생성했다고 발표했다. 발표에는 249쪽 원고와 공개 저장소가 함께 제공됐다.

이미 알려진 답을 재현하는 모델 활용과, 답이 확정되지 않은 영역을 탐색하는 활용은 운영 조건이 다르다. 전자는 채점 기준이나 참조 답안으로 결과를 비교할 수 있다. 반면 미해결 문제에서는 자연어로 잘 정리된 설명이 정확한 해법이라는 보장이 없다.

이 환경에서 모델 산출물은 검증 전까지 결론이 아니라 후보여야 한다. 모델 설명의 완성도와 해답의 정확성은 별개이므로, 생성과 검증을 분리한 구조가 필요하다. 검증기를 통과하지 못한 결과를 확정 저장소로 보내지 않는 규율이 탐색 전체의 신뢰를 지킨다.

탐색 루프는 검증 가능성에서 시작한다

먼저 기계 검증기를 붙일 수 있는 문제인지 판단한다. 문제를 형식 언어로 진술할 수 없으면 해답의 참과 거짓도 판정하기 어렵고, 검증 수단이 없는 산출물은 계속 후보 상태에 머문다. 실패했을 때 손실이 큰 문제와 탐색 자체가 목적인 문제도 구분해 투입 순서를 정해야 한다.

후보 해답 생성은 단발 실행보다 반복 탐색으로 다룬다. 첫 시도가 통과할 가능성이 낮은 만큼, 시도마다 접근 방향을 남겨 동일한 경로가 반복되는 일을 줄인다. 탐색 다양성은 발견 가능성에 직접 영향을 준다.

생성 직후에는 자동으로 검증기에 전달하고, 통과 여부만을 다음 상태로 넘어가는 조건으로 둔다. 사람의 판단을 이 구간의 게이트로 삼으면 병목이 생긴다. 다만 형식 증명이 통과하더라도 원래 문제의 진술과 의도가 일치하는지는 별도의 사람 검토가 필요하다.

⤢✕실패있음소진통과탐색 대상 문제 선별 (검증기확보 가능 여부)형식 진술 작성후보 해 생성중간 추론 과정 보존기계 검증기 통과?실패 후보 격리 저장탐색 예산 잔여?중단 · 상태 저장재현 실행 경로 생성사람 검토 (진술 타당성 · 의미)결과 이력 등록

실패한 후보는 삭제하지 않고 격리 저장한다. 실패 경로도 다음 탐색의 입력이며, 어떤 접근이 막혔는지 보여 주는 기록이기 때문이다. 다만 실패 후보가 결과 저장소로 흘러들지 않도록 저장 경로는 물리적으로 분리해야 한다.

최종 답뿐 아니라 중간 추론 과정도 보관한다. 검토 대상은 결론만이 아니라 그 결론에 이른 논증이며, 추론 기록은 오류 지점을 좁히고 재시도 프롬프트를 만드는 근거가 된다.

재현성과 예산을 산출물의 일부로 다룬다

통과 결과에는 동일 입력으로 같은 검증 결과를 다시 얻을 수 있는 실행 스크립트가 따라야 한다. 검증기 버전과 실행 환경을 산출물에 함께 기록하고, 난수 시드와 모델 버전도 고정해 남긴다. 검증 결과를 재현할 수 없다면 통과 사실 자체도 충분한 증거가 되기 어렵다.

미해결 문제 탐색에는 토큰·시간·비용 단위의 문제별 상한이 필요하다. 이 유형의 작업은 원리상 자원을 끝없이 소모할 수 있으므로, 예산을 넘으면 자동 중단하고 재승인 절차를 거치게 한다. 중단 시점의 상태를 저장해 두면 예산을 다시 배정할 때 이어서 수행할 수 있다.

문제별로 시도 횟수, 검증 통과 여부, 소요 자원, 접근 방향을 누적한다. 성과는 통과 건수만이 아니라 검증 통과율, 문제당 소요 자원, 재현 성공률을 함께 봐야 한다. 단일 지표만 사용하면 쉬운 문제만 선택하는 왜곡이 생길 수 있다.

검증기 중심 구조가 바꾸는 운영 방식

구분 생성·검증 분리 구조 단일 모델 자체 판단
오류 유입 검증기가 차단 모델 확신도에 의존
검토 비용 검증기 구축 후 낮음 건별 사람 검토
적용 범위 형식화 가능 문제 제한 없음
재현성 높음 낮음
초기 비용 검증기 구축 필요 낮음
실패 진단 실패 지점 특정 가능 원인 불명확

생성과 검증을 분리하면 검증기가 오류를 기계적으로 차단한다. 산출물 신뢰도는 검증기 신뢰도 수준으로 보장되고, 검증기 구축 이후 검토 비용도 급격히 낮아진다. 대신 형식화 가능한 문제로 적용 범위가 좁아지며 초기 구축 비용이 든다.

단일 모델의 자체 판단은 즉시 적용할 수 있고 초기 비용도 없다. 그러나 모델이 옳다고 판단한 결과를 걸러낼 수단이 없으므로 그럴듯한 오답이 그대로 통과할 수 있다. 사람이 오답을 판별하기 어려운 미해결 영역에서는 검증 가능성이 확보된 범위에서 생성·검증 분리 구조가 사실상 유일한 선택이 된다.

검증 가능한 문제부터 투입하면 결과 판정이 즉시 가능해 탐색 루프를 자동화하고 실패 시도를 빠르게 버릴 수 있다. 반대로 임의 문제에 바로 적용하면 착수는 빠르지만 산출물이 후보에 머물러 검토 대기열이 무한히 쌓이고 성과 판정도 어려워진다. 자동 루프가 성립하는지가 탐색 규모를 결정하므로, 검증 가능한 문제를 먼저 소진한 뒤 나머지로 넓히는 순서가 자원 효율에서 우위에 있다.

대규모 후보 생성은 반례 발견처럼 한 건만 맞으면 되는 과제에서 발견율이 높다. 검증이 자동화된 경우 후보 수 증가에 따른 비용은 선형에 그치지만, 검증 비용이 높거나 사람 검토가 필요한 구간에서는 병목도 함께 커진다. 소수 정밀 생성은 건당 품질과 상세한 추론 기록으로 검토 부담을 낮출 수 있으나 탐색 다양성이 부족해 좁은 경로에 갇힐 수 있다. 검증 단가가 생성 단가보다 충분히 낮은 구간인지가 전략 선택의 기준이다.

품질 게이트와 연구개발 관리에 연결하기

생성과 검증의 분리는 발산과 수렴 구조에서 수렴 단계를 기계에 맡기는 방식으로 볼 수 있다. 사람은 문제 정의와 의미 판단에 집중하고, 실패 기록은 시행착오를 다시 사용할 수 있는 지식으로 남는다.

검증기 통과를 상태 전이 조건으로 두는 설계는 품질 게이트의 구현이다. 핵심은 게이트를 우회할 수 있는 경로를 남기지 않는 데 있다. 검증 환경과 버전을 보관하는 일도 검증 결과의 추적성과 재현성을 위한 조건이다.

탐색 예산 상한과 중단 규칙은 R&D 스테이지 게이트의 자원 통제 장치와 같은 역할을 한다. 외부에 결과를 공개할 때는 후보와 확정을 구분해 검증 상태를 명시하고, 모델 산출물이 기여한 범위를 기록해 저자성 논란에 대비할 필요가 있다.

검증 가능한 산출물 요구가 넓어지는 방향

기계 검증이 가능한 형식으로 결과를 요구하는 방식은 연구 보조를 넘어 산업 적용 영역으로 확산되는 흐름이다. 문제 형식화 자체를 모델이 보조하면 검증 가능한 문제의 범위도 넓어질 수 있다.

탐색 예산과 성과 판정을 결합한 계산 자원 배분 체계는 연구 조직의 운영 항목으로 자리 잡는 방향이다. AI 산출물 공개에서도 후보와 확정을 구분하는 표기는 기본 요건으로 요구될 가능성이 있다.

Astra 발표가 보여 준 핵심은 결과 자체보다 검증 가능한 형식으로 결과를 냈다는 구조에 있다. 정답이 없는 영역에서는 생성과 검증을 분리하고, 검증기 확보 가능성으로 투입 대상을 선별해야 한다. 통과하지 못한 후보를 후보로 남기고 실패 기록을 보존하는 운영 규율이 탐색 자동화와 신뢰 확보의 출발점이다.

Sources

AI 에이전트형식 검증연구 자동화재현성품질 게이트