본문으로 건너뛰기
오늘의 흐름
DataGeekNews··원문 약 3

Artificial Analysis, AAII v4.2 발표 - 실제 업무 평가 강화, 비공개 테스트 확대

AI 모델의 종합 성능을 비교하는 Intelligence Index v4.2를 공개하며, 복잡한 업무 수행과 장문 문서 분석을 평가에 추가함 수천 개의 자료를 활용하는 에이전트 지식 업무와 여러 페이지에 흩어진 근거를 종합하는 전문 문서 추론을 평가하…

Artificial Analysis, AAII v4.2 발표 - 실제 업무 평가 강화, 비공개 테스트 확대 대표 이미지

핵심 요약

자동 요약
  1. 1AI 모델의 종합 성능을 비교하는 Intelligence Index v4.2를 공개하며, 복잡한 업무 수행과 장문 문서 분석을 평가에 추가함 수천 개의 자료를 활…

원문 본문

출처 · GeekNews

Artificial Analysis, AAII v4.2 발표 - 실제 업무 평가 강화, 비공개 테스트 확대

(artificialanalysis.ai)1P by GN⁺ 4시간전 | ★ favorite | 댓글 1개
  • AI 모델의 종합 성능을 비교하는 Intelligence Index v4.2를 공개하며, 복잡한 업무 수행과 장문 문서 분석을 평가에 추가함
  • 수천 개의 자료를 활용하는 에이전트 지식 업무와 여러 페이지에 흩어진 근거를 종합하는 전문 문서 추론을 평가하고, 상위 모델의 성능이 포화된 GPQA Diamond는 제외함
  • 평가에 맞춰 모델을 최적화하는 편법을 줄이기 위해 비공개 테스트의 가중치를 20%에서 40%로 확대하고, 채점 오류와 실행 환경도 개선함
  • 개편된 종합 지수에서는 Claude Fable 5.1이 선두, GPT-6 Astra가 뒤를 이으며 GPT-5.6 Sol보다 4점 높은 점수를 기록함
  • 세부 평가에서는 Claude가 복잡한 지식 업무에서, GPT-6 Astra가 전문 문서 분석에서 앞섰으며, Astra는 상위권 모델 중 출력 토큰 대비 성능도 두드러짐

모델의 발전에 맞춰 평가 과제도 더 어렵게

  • Artificial Analysis는 2026년 1월 v4를 공개한 이후 8개월간 준비해 온 v5의 일부를 앞당겨 반영
  • 최근 주요 모델이 출시되는 동안 비교 기준을 안정적으로 유지하려고 업데이트를 미뤘지만, 상위 모델의 빠른 발전에 맞춰 중간 개편을 진행함
  • 더 어렵고 현실적인 과제를 추가해 실제 활용 능력을 반영하고, 과학 추론 평가 GPQA Diamond는 성능이 포화돼 제외
  • v5 개발은 계속 진행하며, 가까운 시일 내 추가적인 단계별 업데이트를 계획함

AA-Briefcase: 여러 자료와 연결된 과제를 처리하는 능력

  • AA-Briefcase는 업계 전문가가 설계한 복잡한 프로젝트를 통해 에이전트의 지식 업무 수행 능력을 평가함
  • 각 프로젝트는 사람이 수 주에 걸쳐 수행할 분량으로, 서로 연결된 여러 과제와 수천 개의 원본 자료를 포함함
  • 정해진 기준에 따른 채점과 결과물을 서로 비교하는 평가를 결합함
    • 과제를 실제로 성공했는지, 분석의 품질은 어떤지, 결과물을 얼마나 잘 전달했는지를 함께 평가함
    • 테스트 세트는 비공개로 유지함
  • Claude Fable 5.1과 Opus 5가 선두이며, GPT-6 Astra와 Muse Spark 1.3이 뒤를 이음
  • GPT-6 Astra는 GPT-5.6 Sol보다 약 85 Elo 높은 점수를 기록함

GDP.pdf: 긴 문서에서 근거를 빠짐없이 종합하는 능력

  • Surge AI가 만든 GDP.pdf는 10개 분야의 PDF 100개를 대상으로, 한 번의 요청에서 전문 문서를 분석하고 답하는 능력을 평가함
  • 4,592쪽에 흩어진 텍스트, 표, 차트, 각주와 제외 조건을 함께 읽고 필요한 근거를 종합해야 함
  • 전문가가 작성한 1,275개의 세부 기준으로 채점하며, 대표 지표인 All-pass Rate는 해당 과제의 모든 기준을 충족해야 성공으로 인정
  • GPT-6 Astra가 33.2% 로 선두이며, GPT-5.6 Sol 28.2%, Claude Fable 5.1 26.2% 순임

비공개 테스트 확대와 채점 오류 개선

  • 종합 지수에서 비공개 테스트가 차지하는 가중치를 v4.1의 두 배인 40%로 확대
  • 비공개 데이터에는 AA-Briefcase, AA-Omniscience와 CritPt의 정답이 포함되며, 평가를 편법으로 공략할 여지를 줄이려는 목적임
  • v5에서는 비공개 평가 비중을 더 높일 계획임
  • 채점 과정에서 모델의 실제 능력과 무관하게 결과가 흔들리는 문제도 개선함
    • AA-LCR v1.1은 채점용 시스템 프롬프트를 추가하고 정답표의 오류와 모호한 부분을 수정함
    • GDPval-AA v2와 AA-Briefcase는 표본 추출 방식과 Elo 점수의 기준점을 조정해 새 모델이 추가될 때 평점이 더 안정적으로 유지되도록 함
    • SciCode는 실행이 느리더라도 올바른 코드를 실패로 처리하지 않도록 채점용 샌드박스를 개선함

종합 순위와 비용, 출력 토큰 효율

  • 개편된 종합 지수에서는 Claude Fable 5.1이 1위, GPT-6 Astra가 그다음이며, Astra는 GPT-5.6 Sol보다 4점 높음
  • 개발사별 순위는 Anthropic, OpenAI, Meta, SpaceXAI, Moonshot/Kimi, Z.AI, Google 순임
  • 과제당 비용과 성능의 균형에서는 Anthropic, OpenAI, Meta, Z.AI의 모델들이 파레토 프런티어를 구성함
    • 더 저렴하면서 성능도 높은 다른 모델이 없는 경계에 해당하며, 비용대별로 경쟁력 있는 모델을 보여줌
  • 출력 토큰 수 대비 성능에서는 GPT-6 Astra가 지능 선두권의 거의 모든 다른 모델보다 높은 효율을 보임
    • Claude Fable 5.1, Grok 4.5, Gemini 3.5 Flash-Lite도 해당 곡선의 양 끝에 위치함
    • 이 비교는 종합 지수 25점 미만 모델을 제외한 결과임
  • 세부 평가 구성과 계산 방식은 Artificial Analysis Intelligence Index 방법론에서 확인 가능

댓글과 토론

이 글은 GeekNews 의 원문을 정제해 보여드립니다. 저작권은 원저작자에게 있습니다.

전체 내용이 궁금하다면

GeekNews 원문에서 이어 읽기

원문 보기

비슷한 글

5유사도 추천