뉴스2026년 2월 5일2026-02-052분Verified
AI 성능 그래프의 함정과 METR 자율성 지표
단순 벤치마크 점수를 넘어 자율적 문제 해결 능력을 측정하는 METR 지표의 중요성과 실질적 모델 검증 방안을 살펴봅니다.
단순 벤치마크 점수를 넘어 자율적 문제 해결 능력을 측정하는 METR 지표의 중요성과 실질적 모델 검증 방안을 살펴봅니다.
Gemini 3 Flash와 o3 모델 분석 결과, 업무 계획 능력 부족과 높은 비용이 에이전트 도입의 주요 병목으로 나타났습니다.
SWE-bench 벤치마크에서 GPT 5.2는 78.5%, Claude Opus 4.5는 80%를 기록하며 새로운 기준을 제시했다. 환각 감소와 추론 능력에서 극명한 차이를 보인다.