본문으로 건너뛰기
오늘의 흐름
AIGeekNews··원문 약 3

GPT-6 Astra, 수능 벤치마크 첫 전 영역 만점

개인 개발자가 운영하는 2026학년도 수능 LLM 평가에서 GPT-6 Astra가 처음으로 종합 450점 만점을 기록함 국어와 수학의 모든 선택과목, 영어, 한국사와 평가 대상 탐구 4과목을 모두 맞혔으며, 기존 모델들이 어려워했던 사회문화 8번도 해…

GPT-6 Astra, 수능 벤치마크 첫 전 영역 만점 대표 이미지

핵심 요약

자동 요약
  1. 1개인 개발자가 운영하는 2026학년도 수능 LLM 평가에서 GPT-6 Astra가 처음으로 종합 450점 만점을 기록함 국어와 수학의 모든 선택과목, 영어, 한국…

원문 본문

출처 · GeekNews

GPT-6 Astra, 수능 벤치마크 첫 전 영역 만점

(hehee9.github.io)3P by GN⁺ 12시간전 | ★ favorite | 댓글 3개
  • 개인 개발자가 운영하는 2026학년도 수능 LLM 평가에서 GPT-6 Astra가 처음으로 종합 450점 만점을 기록함
  • 국어와 수학의 모든 선택과목, 영어, 한국사와 평가 대상 탐구 4과목을 모두 맞혔으며, 기존 모델들이 어려워했던 사회문화 8번도 해결함
  • 일반 모드에서 입력 약 22만 6,000개, 출력 약 13만 1,000개의 토큰을 사용해 출력이 입력의 약 58%에 그침
  • 한 문제씩 풀면 만점이지만, 한 과목의 문제를 한꺼번에 입력하면 사회문화 8번을 틀려 448.5점을 기록함
  • 외부 검색과 계산기 없이 진행한 평가지만, 문제가 학습에 포함됐을 가능성이 있어 처음 보는 문제에 대한 추론 능력만을 측정한 결과로 단정할 수는 없음

평가 대상 전 영역에서 첫 만점

  • 2026 수능 LLM 풀이 기록은 여러 모델의 답안, 성적과 토큰 사용량을 공개하는 비공식 평가 프로젝트
  • 평가 대상은 국어, 수학, 영어, 한국사와 물리학Ⅰ, 화학Ⅰ, 생명과학Ⅰ, 사회문화임
    • 국어와 수학은 공통 문항에 모든 선택과목의 평균 점수를 더함
    • 탐구는 4과목 평균에 2를 곱해 100점으로 환산하며, 전체 합계는 450점 만점
  • GPT-6 Astra는 이 평가에 포함된 전 영역을 모두 맞힌 첫 모델이며, 수능에 존재하는 모든 탐구 과목을 시험했다는 뜻은 아님
  • 일반 모드의 high 설정에서 국어 100점, 수학 100점, 영어 100점, 한국사 50점, 탐구 환산 100점을 기록함

만점과 함께 눈에 띄는 토큰 사용량

  • 일반 모드에서 입력 약 22만 6,000개, 출력 약 13만 1,000개의 토큰을 사용함
  • 실험 공개자는 만점뿐 아니라 출력 토큰이 입력보다 훨씬 적다는 점을 주요 특징으로 짚음
  • 다만 토큰을 적게 썼다고 실제 비용도 항상 가장 낮은 것은 아님
    • 일반 모드에서는 API 단가 차이로 GPT-5.6 Sol보다 비용이 높았음
    • 과목별 일괄 입력 모드에서는 Claude Opus 5와 Fable 5.1보다 낮은 비용으로 전체 풀이를 수행했다고 보고함

입력 방식에 따라 달라지는 성적

  • 일반 모드는 필요한 지문과 문제를 한 문항씩 입력하는 방식
  • 고난도 모드는 더 어려운 문제를 추가하는 것이 아니라, 같은 과목의 모든 문제를 한 번에 풀게 하는 방식
  • 고난도 모드에서는 사회문화 8번 한 문항을 틀려 448.5점으로 GPT-5.6 Sol Pro와 같은 점수를 기록함
  • 문제는 PDF에서 텍스트를 추출하고 오류를 수작업으로 수정한 뒤 입력하며, 수식은 LaTeX로 변환함
  • 그래프와 도표는 이미지로 별도 첨부하며, 시험지 PDF 전체나 페이지 전체 캡처를 그대로 넣지는 않음

평가 조건과 주의사항

  • Astra는 공식 API로 실행하며, 별도 시스템 프롬프트나 검색, 계산기 등 외부 도구를 제공하지 않음
  • 추론 예산과 최대 출력 한도를 충분히 높게 설정하므로, 일반 웹/앱에서 사용하는 결과와는 다를 수 있음
  • 온도와 Top P 등은 기본값을 사용해 실행마다 성적에 편차가 있을 수 있음
  • 일부 비교 모델의 최고 추론 설정 점수는 낮은 설정에서 틀린 문항만 재평가한 결과이므로, 비교할 때 표시된 조건을 확인해야 함
  • 실험 공개자도 Astra의 지식 컷오프가 시험 이후라는 점을 밝혔으며, 대시보드에는 문제 학습 가능성을 표시함
  • 문제와 정답이 실제로 학습에 포함됐는지를 확인한 실험은 아니므로, 이 결과만으로 미학습 문제에서의 성능까지 판단하기는 어려움

관련 자료

댓글과 토론

이 글은 GeekNews 의 원문을 정제해 보여드립니다. 저작권은 원저작자에게 있습니다.

전체 내용이 궁금하다면

GeekNews 원문에서 이어 읽기

원문 보기

비슷한 글

5유사도 추천