OpenAI가 Codex 컨텍스트를 372k에서 272k로 조용히 줄였다? 개발자들이 'Codex Resets'로 감시에 나선 이유
AI 코딩 도구를 매일 쓰는 분이라면 최근 이런 경험 한 번쯤 있으셨을 겁니다. 어제까지 멀쩡하게 긴 코드를 물고 있던 도구가, 오늘은 갑자기 앞부분을 까먹은 듯한 반응을 보이는 거죠. 요즘 개발자 커뮤니티에서 뜨거운 주제가 바로 이겁니다. OpenAI의 Codex가 컨텍스트 윈도우를 372k에서 272k로 조용히 줄인 것 아니냐는 의혹입니다.
먼저 솔직하게 말씀드리면, 이번 주제는 아직 대규모로 확인된 커뮤니티 데이터가 많지 않습니다. 최근 30일 사이 정식으로 확인된 논의가 제한적인 상황인데요. 그래서 이 글은 확정된 사실 보도가 아니라, 개발자들 사이에서 왜 이런 의심이 번지고 어떤 방식으로 검증이 이뤄지고 있는지를 짚어보는 데 초점을 맞추겠습니다.
컨텍스트 윈도우가 뭐길래 100k나 신경 쓸까
컨텍스트 윈도우는 쉽게 말해 AI가 한 번에 기억할 수 있는 작업 메모리입니다. 사람으로 치면 대화하면서 머릿속에 담아둘 수 있는 정보의 총량이죠. 이 크기를 토큰 단위로 재는데, 372k는 대략 30만 단어에 가까운 분량을 한 번에 다룰 수 있다는 뜻입니다.
이 숫자가 개발자에게 중요한 이유는 명확합니다. 컨텍스트가 크면 여러 파일을 한꺼번에 물고 리팩터링을 시킬 수 있습니다. 반대로 이게 줄면 도구가 프로젝트 전체를 못 보고 조각조각만 이해하게 됩니다. 372k에서 272k로 줄었다면 무려 100k가 사라진 셈인데, 이는 파일 수십 개 분량이 시야에서 빠지는 것과 같습니다.
그래서 100k라는 숫자가 결코 사소하지 않습니다. 구독료는 그대로인데 도구의 실질 성능이 깎였다면, 이건 조용한 가격 인상이나 마찬가지니까요.
‘조용히’가 문제의 핵심입니다
사실 스펙 변경 자체는 있을 수 있는 일입니다. 문제는 공지 없이 바뀌었다는 의혹에 있습니다.
AI 서비스는 전통적인 소프트웨어와 다릅니다. 버전 번호가 딱 박히는 게 아니라, 같은 이름의 모델이 뒤에서 슬그머니 튜닝되거나 파라미터가 조정되는 일이 잦습니다. 사용자 입장에서는 어제와 오늘의 도구가 같은 이름을 달고 있으니 무엇이 바뀌었는지 알 방법이 없습니다. 이게 바로 정보 비대칭입니다.
개발자들이 특히 예민하게 반응하는 지점이 여기입니다. 성능 저하를 체감했는데 공식 발표는 없으니, “내 착각인가” 싶은 답답함이 쌓이는 거죠. 이런 상황에서 사람들이 하는 일은 하나입니다. 직접 재보는 겁니다.
‘Codex Resets’, 집단 추적이 시작된 방식
바로 이 지점에서 등장한 게 개발자들의 자발적 추적 움직임입니다. 요지는 간단합니다. 회사가 안 알려주면 우리가 직접 측정해서 기록으로 남기자는 거죠.
방식은 이렇습니다. 일정한 길이의 긴 입력을 준비해두고, 도구가 어디까지 기억하는지 반복해서 확인합니다. 특정 시점부터 앞부분을 잊기 시작한다면, 그게 바로 실제 컨텍스트 한계선입니다. 이런 테스트를 여러 명이 같은 조건으로 돌려서 결과를 모으면, 혼자서는 ‘착각’으로 끝났을 관찰이 재현 가능한 데이터가 됩니다.
이건 AI 시대 소비자 감시의 전형적인 패턴이기도 합니다. 과거에도 특정 모델이 조용히 바뀌었다는 의혹이 나올 때마다, 커뮤니티는 벤치마크를 공유하고 스크린샷을 모아 압박했습니다. 개인의 체감을 집단의 증거로 바꾸는 과정인데요. 기업이 침묵할수록 이런 자경단식 검증은 더 정교해집니다.
이 논란이 진짜로 말해주는 것
한 걸음 물러나서 보면, 이번 일은 특정 도구 하나의 스펙 문제를 넘어섭니다. AI 서비스 전반의 신뢰 구조에 관한 이야기입니다.
우리는 지금 성능이 언제든 바뀔 수 있는 제품에 매달 돈을 내고 있습니다. 그런데 그 변화를 감지할 계기판이 사용자 손에는 없습니다. 이런 구조가 계속되면, 아무리 좋은 도구라도 “오늘의 이 도구가 어제와 같은가"라는 근본적 불신이 남습니다. 신뢰는 성능만으로 쌓이지 않습니다. 예측 가능성과 투명성이 있어야 합니다.
물론 반대편 논리도 있습니다. 인프라 비용이나 안정성 문제로 불가피하게 조정했을 수 있고, 그런 결정이 늘 나쁜 것도 아닙니다. 핵심은 결정 자체가 아니라 알리는 방식에 있습니다. 짧은 릴리스 노트 한 줄이면 될 일을 침묵으로 처리할 때, 사용자는 배신감을 느끼는 겁니다.
다시 강조하지만 이번 372k→272k 의혹은 아직 폭넓게 검증이 끝난 사안이 아닙니다. 그럼에도 이야기할 가치가 있는 이유는, 개발자들이 스스로 계기판을 만들어 감시에 나선 그 움직임 자체가 시사하는 바가 크기 때문입니다. 여러분이 매일 쓰는 AI 도구는, 오늘도 어제와 정말 같은 성능일까요? 그걸 확인할 방법이 여러분에게 있으신가요?
댓글
댓글을 불러오는 중...