영국 AISI, AI 평가 결과·설정 공개
핵심 요약
AISI와 이벌이벌이 6개 프런티어 모델의 벤치마크 결과와 실행 설정을 공개해 재현성을 높였다.
허깅페이스 커뮤니티의 평가 프로젝트 이벌이벌(EvalEval)은 영국 AI안보연구소(AISI)가 평가 결과를 공개 플랫폼 ‘Evaluation Cards’에 공유한다고 9월 22일 밝혔다. 평가 방법과 결과, 설정 정보를 공통 보고 규격 ‘Every Eval Ever(EEE)’에 맞춰 제공해 AI 벤치마크를 더 쉽게 재현·검증하려는 협력이다.1
이번 공개에는 HealthBench, FrontierMath, Humanity’s Last Exam, SWE-Bench Pro, Terminal-Bench 2.0 등 5개 벤치마크에서 검증한 결과가 담겼다. 대상은 Claude Opus 4·4.5·4.6과 GPT-5·5.2·5.4 등 프런티어 모델 6종이다. 일부 모델 구성이 겹치는 사이버 평가 Cyber CTFs와 The Last Ones 결과도 포함됐다.
데이터는 추론 단계의 연산량과 평가 절차가 벤치마크 성능에 미치는 영향을 분석한 AISI 논문과 함께 공개됐다. Humanity’s Last Exam에서는 시도마다 정답 여부를 알려주는 조건에서 토큰 사용량이 늘수록 추가 문제를 해결했다. 이는 같은 모델이라도 추론 예산과 평가 설정에 따라 점수가 달라질 수 있음을 보여준다. 이벌이벌은 평가 재실행 비용이 클 수 있는 만큼, 실행 기록과 설정을 함께 공개한 자료가 결과를 해석하고 비교하는 기준점이 될 수 있다고 설명했다.
Footnotes
-
Hugging Face 블로그·커뮤니티, 「How UK AISI and EvalEval Are Making Benchmark Results Reproducible」 ↩
읽기 목록은 이 브라우저에 저장됩니다.
출처
- How UK AISI and EvalEval Are Making Benchmark Results Reproducible — Hugging Face 블로그·커뮤니티 · 자료: 2026. 9. 22.
이 글은 위 출처를 근거로 자동 생성된 뒤 발행됐습니다. 원문을 함께 확인해 주세요. 교차 보도 없이 단독 출처로 작성됐습니다.