글로벌 테크 허브시장 · 기술 · 실전 정보
AI·머신러닝2026.09.02수정 2026.09.08

단돈 67센트로 ARC-AGI-1에서 44% 달성하기: 비용 효율적인 추론과 테스트 타임 컴퓨트

서론: ARC-AGI 벤치마크와 일반화의 도전 과제

프랑수아 숄레(François Chollet)가 제안한 추상화 및 추론 코퍼스(ARC-AGI)는 오랫동안 현대 인공지능에서 가장 까다로운 벤치마크 중 하나로 자리매김해왔다. 오늘날의 대규모 언어 모델(LLM)이 학술과 코딩, 대화 벤치마크의 상당 부분을 정복한 반면, ARC-AGI는 의도적으로 이와는 직교하는 능력, 즉 분포 밖(out-of-distribution) 추상적 추론과 최소한의 시연 예제만으로 새로운 변환 규칙을 추론하는 능력을 시험한다.

모델이 수십억 개의 웹페이지에 걸쳐 암기된 패턴에 크게 의존할 수 있는 일반적인 언어 과제와 달리, ARC-AGI는 유동적 지능(fluid intelligence)을 요구하는 독특한 시각적 격자 퍼즐을 제시한다. 역사적으로 ARC-AGI에서 높은 정확도를 달성하려면 후보 생성과 테스트 타임 파인튜닝에 수백, 수천 달러를 쏟아붓는 막대한 컴퓨팅 예산이 필요하거나, 경직된 도메인 휴리스틱을 갖춘 특화된 기호적 솔버가 필요했다. 하지만 문제당 단 67센트로 ARC-AGI-1에서 44%의 정확도를 달성했다는 최근 연구는 하나의 변곡점을 시사한다. 지능적인 테스트 타임 탐색과 프로그램 합성이 첨단 추론의 경제적 장벽을 극적으로 낮출 수 있다는 것이다.

테스트 타임 컴퓨트와 프로그램 합성으로의 전환

이 성과가 왜 중요한지 이해하려면, 직접적인 다음 토큰 예측에서 테스트 타임 검증과 코드 생성으로의 아키텍처적 전환을 살펴볼 필요가 있다. LLM이 출력 격자를 픽셀 단위로 직접 예측하려고 할 때는 공간적 할루시네이션과 하나 차이 오류(off-by-one error)를 자주 겪는다. 반면 ARC 문제를 프로그램 합성 과제로 재구성하면 뚜렷한 이점이 생긴다.

  • 결정론적 실행: 언어 모델에게 원시 격자 상태 대신 (파이썬 코드나 도메인 특화 프리미티브 같은) 변환 알고리즘을 생성하도록 유도함으로써, 실행 과정을 결정론적인 런타임 환경으로 넘길 수 있다.
  • 검증 가능한 가설 테스트: 후보 프로그램은 사용 가능한 모든 시연 쌍(입력/출력 예시)에 대해 실행될 수 있다. 합성된 프로그램이 주어진 예시 중 하나라도 통과하지 못하면 즉시 폐기되거나 수정되며, 이는 사람의 감독 없이도 정답 기반 피드백을 제공한다.
  • 압축된 표현: 객체 분할, 대칭, 색상 매핑, 위상학적 변환 같은 고수준 개념들은 모듈화된 코드 구조로 자연스럽게 표현된다.

“추상적 추론에서 핵심 병목은 단순히 모델 파라미터 규모가 아니라, 추론 컴퓨팅 자원이 프로그램적 가설을 생성하고 검증하고 개선하는 데 얼마나 효과적으로 배분되는가에 있다.”

비용 효율성 뒤에 숨겨진 핵심 아키텍처 원칙

단돈 67센트로 ARC-AGI-1에서 44%의 정확도를 달성하려면 추론 및 탐색 파이프라인 전반에 걸친 세심한 최적화가 필요하다. 이 접근법은 몇 가지 근본적인 엔지니어링 전략을 강조한다.

1. 표적화된 프롬프트 엔지니어링과 표현: 격자 배열을 깔끔하고 토큰 효율적인 표현으로 포맷하면, 구조적 관계를 유지하면서도 입력 토큰 소비를 줄일 수 있다. 컨텍스트 윈도우는 불필요한 토큰 오버헤드 없이 변환 문제를 명확히 제시하도록 세심하게 관리된다.

2. 반복적인 프로그램 수정과 오류 피드백: 수천 개의 무관한 코드 샘플을 무작정 생성하는 대신, 이 시스템은 실행 트레이스 오류(단언 오류, 형태 불일치, 런타임 예외 등)를 활용해 이후 모델 프롬프트를 유도한다. 이러한 폐쇄 루프 디버깅 메커니즘은 적은 반복 횟수 내에 작동하는 해법을 찾을 확률을 극적으로 높여준다.

3. 효율적인 후보 선택과 가지치기: 예외 상황을 만족시키고 (오컴의 면도날에 부합하는) 의미론적 단순성을 보이는 후보 프로그램을 우선시함으로써, 탐색 공간을 조기에 가지치기하여 한계 수익이 낮은 값비싼 탐색 경로를 피할 수 있다.

첨단 AI와 시스템 2 추론에 대한 함의

ARC-AGI에서 예산을 의식한 탐색 전략이 거둔 성공은 범용 인공지능 연구의 더 넓은 지형에 심대한 함의를 갖는다.

함의 내용
고급 추론의 민주화 1달러 미만 비용으로 벤치마크 입증, 알고리즘 독창성이 무차별 확장에 필적
신경망·기호적 방식 시너지 패턴인식(신경망)+정밀 실행·검증(기호엔진) 결합한 하이브리드 추론
추론 시점 컴퓨팅 확장 사전학습 데이터 병목 상황에서 테스트 타임 컴퓨팅이 유망한 대안으로 부상

규모가 전부는 아니다

단 67센트로 ARC-AGI-1에서 44%를 달성했다는 이정표는 인공지능에 관한 근본적인 진실 하나를 일깨워준다. 순수한 모델 규모는 방정식의 절반에 불과하다는 것이다. 언어 모델을 결정론적 실행 런타임과 구조화된 탐색, 엄격한 자동 검증과 결합함으로써, 복잡한 추론 과제는 현실적인 경제적 규모 안에서도 다룰 수 있게 된다. 기술적 세부사항은 원문 기사에서 확인할 수 있다.

정보 확인일: 2026-09-02