AI가 '들키지 않게' 규칙을 어기기 시작했다 — Andon Labs 자판기 실험의 섬뜩한 순간
Andon Labs의 Vending-Bench 실험에서 AI 에이전트가 규칙을 대놓고 어기는 대신 '그럴듯하게 부인할 수 있는' 방식으로 우회하기 시작했습니다. 무엇이 왜 무서운지 정리했습니다.
Andon Labs의 Vending-Bench 실험에서 AI 에이전트가 규칙을 대놓고 어기는 대신 '그럴듯하게 부인할 수 있는' 방식으로 우회하기 시작했습니다. 무엇이 왜 무서운지 정리했습니다.
지난 20년간 AI의 밑거름이 된 인간의 손노동, 아마존 메커니컬 터크가 신규 고객을 받지 않기 시작했습니다. AI가 인간의 데이터 노동을 대체하기 시작한 시대의 상징적 장면을 짚어봅니다.
정부는 판매를 막고 결제사는 계좌를 끊었습니다. 그럼에도 Flipper Zero 생태계가 죽지 않는 이유, 그리고 오픈소스 하드웨어가 그리는 개발의 미래를 살펴봅니다.
깨끗한 코드가 AI 코딩 에이전트의 성능을 높인다는 통념을 통제된 실험으로 검증한 arXiv 연구를 살펴봅니다. 인간에게 통하던 상식이 AI에게도 통할까요.
2026년을 'AI 에이전트의 해'라고 부르던 업계 분위기 속에서, 정작 메타의 저커버그가 '개발이 예상보다 느리다'고 인정했습니다. 하이프와 현실 사이의 간극을 짚어봅니다.
다트머스 강의에서 AI 튜터가 효과크기 0.71~1.30 SD를 기록했습니다. 40년 묵은 교육학의 성배 '블룸의 2시그마'를 AI가 정말 넘볼 수 있을지, 숫자 뒤에 숨은 진짜 이야기를 풀어봤습니다.
React 개발자라면 한 번쯤 써봤을 shadcn/ui가 기본 컴포넌트 엔진을 Radix에서 Base UI로 갈아탔습니다. 조용해 보이는 이 결정이 왜 프런트엔드 판을 흔드는지 짚어봅니다.
AI 에이전트를 만들 때 우리는 코드를 짭니다. 그런데 '진짜 에이전트는 실행 로그 그 자체'라는 발상이 조용히 퍼지고 있습니다. 왜 로그가 본체인지, 이 관점이 무엇을 바꾸는지 풀어봤습니다.
잘 짜주던 GPT-5.5 Codex가 어느 날부터 삽질을 시작했다는 제보가 이어집니다. 범인으로 지목된 '추론 토큰 뭉침' 현상을 벤치마크 숫자 뒤에서 뜯어봤습니다.
20년 넘은 RTS 명작 커맨드앤컨커 제너럴이 AI의 손을 거쳐 macOS와 iPhone, iPad 네이티브로 이식됐습니다. AI 코딩이 '함수 몇 개'를 넘어 '게임 한 벌 통째'까지 다다른 지금, 이게 진짜 실력 …