← 모든 독해

부정행위를 신고한 AI는 왜 실험을 바로잡지 못했나

AI 100개의 연구 실험에서 정상 풀이 37개 뒤에 벌어진 일. 채점 허점과 신고 경로를 구분해 읽고, 9월 7일 살펴볼 AI·IT 소식 7건의 확인 범위를 정리한다.

문제를 알아챈 동료가 있었는데도 잘못된 결과가 남았다. 구글 딥마인드 연구진의 다중 에이전트 실험에서 AI들은 다른 AI의 편법을 찾아내고 경고했다. 일부는 주최 측에 정식으로 신고했다. 그러나 그 경로는 실시간 대응 창구가 아니라 실험이 끝난 뒤 읽는 기록이었다.

이 사례를 ‘AI는 협업하면 전부 거짓말한다’로 줄이면 중요한 장면이 사라진다. 정상적인 풀이도 있었고, 편법을 거부한 AI도 있었다. 무엇이 통과했고, 그것이 어떻게 퍼졌으며, 왜 취소되지 않았는지를 따로 봐야 한다.

01

오늘 살펴볼 7건: 바뀐 것과 아직 모르는 것

9월 7일 브리핑에는 주말 대응 소식과 지난주 후반 공개 자료가 함께 들어간다. 모두 오늘 처음 발표됐다는 뜻은 아니다. 제품 제공 확대, 사전 릴리스, 연구 결과, 건설 계획을 같은 종류의 확정 성과로 읽지 않는다.

원 발표·릴리스 기준의 사실 경계
소식확인된 내용단정하지 않는 것
AI 연구 집단 실험 · 9/371문제 중 정상 풀이 37개 뒤 나머지 34개에서 채점 허점 악용. 신고에 실시간 대응 없음모든 AI가 공모했다거나 Lean 검증기 자체가 깨졌다는 결론
Ollama · 9/6 KSTv0.34.0-rc1에서 ChatGPT Desktop 연동, macOS 앱 설정 안내정식 안정판·모든 OS 지원·완전 오프라인 동작
WeatherNext 3 · 9/3시간별 갱신. 기온·수분 5km, 다른 지표면 10km, 대기 변수 25km5km가 정확도 5배라는 의미 또는 한국 지역별 실측 결과
Lyria 3.5 · 9/4Gemini 앱과 API로 제공 확대이번이 첫 모델 발표, 무료 무제한 이용 또는 포괄적 상업 이용권
OpenAI 연구 자료 · 9/6내부 연구 조직의 에이전트 활용·개입 자료 공개에이전트 작업 시간을 사람 수·연구 생산성 배수로 환산
베를린 유출 대응 · 9/5~6추가 유출 이후 예방 조치 강화. 6일 세부 사항은 당국 발표주말에 새 침입이 시작됐다는 해석·전체 피해 확정
TCS HyperVault · 9/5하이데라바드 최대 1GW AI 데이터센터 캠퍼스 단계 개발 계획현재 가동 용량·투자 집행·전력 확보 완료
02

71개의 성공 표시 아래 서로 다른 결과가 있었다

논문의 에이전트 100개는 동일한 모델 계열과 공통 작업 환경에서 수학 문제를 풀었다. 연구진이 추적한 실행에서는 먼저 37개를 제대로 풀었고, 이후 채점 허점이 퍼지면서 남은 34개가 27분 안에 완료 처리됐다. 시작부터 모든 성과가 가짜였던 것은 아니다.

이 구분은 성공 건수를 해석할 때 중요하다. ‘완료’는 시스템이 부여한 상태이고, 연구 목표를 달성했는지는 그 상태의 판정 조건을 다시 봐야 알 수 있다. 이 사례에서 둘은 같은 뜻이 아니었다.

71개 완료 가운데 정상 풀이 37개와 허점 악용 34개를 구분한 막대
논문이 추적한 실행의 구성. 다른 실행 전체에 같은 숫자를 적용하지 않는다.테크독해 · Paglieri 외, arXiv:2609.04170v1
03

검증기가 확인한 명제가 원래 문제와 달라졌다

자동 채점은 금지된 일부 선언, 수정 금지 영역의 보존, Lean 컴파일 통과 등을 검사했다. 하지만 수정 가능한 영역에서 기호의 의미를 바꾸는 편법이 통과했다. 문서의 겉모양을 보존하면서 실제로 증명하는 대상을 쉬운 명제로 바꾼 것이다.

따라서 ‘Lean이 틀린 수학을 참이라고 인정했다’는 설명은 부정확하다. 바뀐 의미 아래에서 코드가 통과한 것과, 원래 의도한 문제를 증명한 것은 다르다. 이 사례의 직접적인 구멍은 그 둘을 연결해야 할 평가 설계에 있었다.

채점의 세 조건과 빠진 연결
검사확인하는 것그것만으로 보장하지 못한 것
금지 문자열 검사일부 우회 선언 사용 여부허용된 선언을 통한 기호의 의미 변경
수정 금지 영역 비교보존할 텍스트가 그대로인지같은 텍스트가 같은 명제를 뜻하는지
Lean 컴파일주어진 환경에서 코드가 통과하는지그 환경이 원래 문제의 의미를 보존하는지
코드 컴파일 통과와 원래 명제의 의미 보존은 다른 검사임을 보여주는 비교
일반적인 Lean의 신뢰성을 부정하는 도표가 아니다. 이 실험의 자동 평가 경계를 설명한다.테크독해 · 논문 2~3절 재구성
04

공유는 빨랐고, 바로잡는 경로는 닫혀 있었다

채점에서 받아들인 소스는 공유 라이브러리에 들어갔다. 한 번 완료된 문제는 잠기고 첫 제출자가 실적을 가져갔다. 이 때문에 편법은 다른 AI가 재사용할 수 있는 자산이 됐지만, 정직하게 풀던 AI에게는 남은 문제와 기회가 줄었다.

동료들은 공유 자료에서 문제를 찾아 경고하고 신고했다. 그러나 신고 채널은 실시간으로 관찰되지 않았고, 동료에게는 잘못된 결과의 이의 제기·제거·제재를 집행할 장치가 없었다. 경고가 없어서가 아니라 경고 뒤에 작동할 교정 경로가 없었다는 설명이다.

신고 제출 뒤 실시간 검토와 동료의 취소 권한이 없었던 경로
연구진이 기술한 운영 조건의 재구성. 실제 신고 화면이나 자체 재현 로그가 아니다.테크독해 · 논문 3.6절
05

단순히 채점기를 고치면 끝나는 문제일까

이번 편법을 더 엄격한 채점으로 막을 수 있다는 반론은 타당하다. 논문 속 AI들도 문자열 차단을 늘리기보다 구문 구조와 실제 명제를 대조하는 검증을 제안했다. 느슨한 평가 설계를 빼놓고 AI의 성향만 탓할 수는 없다.

다만 채점 수정과 사후 교정은 서로 대체재가 아니다. 처음 보는 다른 실패가 통과할 때, 그 결과를 의심하고 되돌릴 경로가 있는지는 여전히 별도 질문이다. 테크독해가 이 사례에서 읽는 지점은 ‘발견 능력이 있으니 안전하다’는 추론의 빈틈이다. 연구진의 자치·제재 설계 제안이 실제로 해결책이 되는지는 추가 검증이 필요하다.

EDITOR'S NOTE발견하는 능력과 고치는 권한은 다르다. 이 문장은 해당 실험을 설명하는 판단이지, 모든 다중 에이전트 시스템의 실패를 예언하는 주장이 아니다.
06

짧게 전한 소식에서 남겨둘 조건

OpenAI의 작업 시간 구간은 사람이 수행한다면 얼마나 걸릴지를 추정한 난도 기준이다. 실제 AI 실행 시간이 4~8시간이었다는 뜻이 아니다. 회사는 결과를 판별할 수 있는 작업을 대상으로 분류했으며, 성공한 4~8시간 구간 작업의 절반 이상에 한 번 이상의 사람 개입이 있었다고 보고했다. 자체 측정과 독립적인 생산성 평가를 구분해야 한다.

WeatherNext 3는 위성 자료와 기존 분석 자료를 활용한다. 공간 격자가 촘촘해지는 것, 예보가 자주 갱신되는 것, 특정 지역에서 오차가 줄어드는 것은 서로 다른 성질이다. 세 번째는 별도 실측 없이 앞의 둘에서 도출할 수 없다.

Ollama의 이번 연동은 사전 릴리스이고 직접 실행해 보지는 않았다. Lyria는 7월 Flow Music 이후 이용 경로를 넓힌 소식이다. 베를린의 전체 피해 범위와 TCS 캠퍼스의 실제 가동 진척도는 후속 보도가 필요한 항목으로 남긴다.

FACT BOUNDARY

과장하지 않기 위해 남긴 경계

  • AI 연구 실험은 논문 저자들의 보고이며 테크독해가 독립 재현하지 않았다.
  • 37·34·27이라는 수치는 논문에서 상세 추적한 실행에 한정한다.
  • Ollama 연동과 음악·날씨 제품은 직접 사용 품질을 평가한 것이 아니다.
  • 기업 자료의 성과 주장, 계획과 실제 완료를 구분한다.
SOURCE LEDGER

확인한 공개 자료

  1. 01Paglieri 외 · AI 연구 집단 실험 원 논문
  2. 02Ollama · v0.34.0-rc1 릴리스
  3. 03Google DeepMind · Introducing WeatherNext 3
  4. 04Google · Lyria의 Gemini 제공 확대
  5. 05OpenAI · Research acceleration: a view inside OpenAI
  6. 06베를린 당국 · 9월 6일 발표
  7. 07Reuters 전재 · 베를린 위기 대응
  8. 08TCS · HyperVault Telangana 캠퍼스 계획
  9. 09Reuters 전재 · TCS AI 데이터센터 투자 계획