AIGeekNews··원문 약 3분
GPT-6 Astra, 수능 벤치마크 첫 전 영역 만점
개인 개발자가 운영하는 2026학년도 수능 LLM 평가에서 GPT-6 Astra가 처음으로 종합 450점 만점을 기록함 국어와 수학의 모든 선택과목, 영어, 한국사와 평가 대상 탐구 4과목을 모두 맞혔으며, 기존 모델들이 어려워했던 사회문화 8번도 해…
핵심 요약
자동 요약- 1개인 개발자가 운영하는 2026학년도 수능 LLM 평가에서 GPT-6 Astra가 처음으로 종합 450점 만점을 기록함 국어와 수학의 모든 선택과목, 영어, 한국…
원문 본문
출처 · GeekNews▲
GPT-6 Astra, 수능 벤치마크 첫 전 영역 만점
(hehee9.github.io)3P by GN⁺ 12시간전 | ★ favorite | 댓글 3개- 개인 개발자가 운영하는 2026학년도 수능 LLM 평가에서 GPT-6 Astra가 처음으로 종합 450점 만점을 기록함
- 국어와 수학의 모든 선택과목, 영어, 한국사와 평가 대상 탐구 4과목을 모두 맞혔으며, 기존 모델들이 어려워했던 사회문화 8번도 해결함
- 일반 모드에서 입력 약 22만 6,000개, 출력 약 13만 1,000개의 토큰을 사용해 출력이 입력의 약 58%에 그침
- 한 문제씩 풀면 만점이지만, 한 과목의 문제를 한꺼번에 입력하면 사회문화 8번을 틀려 448.5점을 기록함
- 외부 검색과 계산기 없이 진행한 평가지만, 문제가 학습에 포함됐을 가능성이 있어 처음 보는 문제에 대한 추론 능력만을 측정한 결과로 단정할 수는 없음
평가 대상 전 영역에서 첫 만점
- 2026 수능 LLM 풀이 기록은 여러 모델의 답안, 성적과 토큰 사용량을 공개하는 비공식 평가 프로젝트
- 평가 대상은 국어, 수학, 영어, 한국사와 물리학Ⅰ, 화학Ⅰ, 생명과학Ⅰ, 사회문화임
- 국어와 수학은 공통 문항에 모든 선택과목의 평균 점수를 더함
- 탐구는 4과목 평균에 2를 곱해 100점으로 환산하며, 전체 합계는 450점 만점
- GPT-6 Astra는 이 평가에 포함된 전 영역을 모두 맞힌 첫 모델이며, 수능에 존재하는 모든 탐구 과목을 시험했다는 뜻은 아님
- 일반 모드의
high설정에서 국어 100점, 수학 100점, 영어 100점, 한국사 50점, 탐구 환산 100점을 기록함
만점과 함께 눈에 띄는 토큰 사용량
- 일반 모드에서 입력 약 22만 6,000개, 출력 약 13만 1,000개의 토큰을 사용함
- 실험 공개자는 만점뿐 아니라 출력 토큰이 입력보다 훨씬 적다는 점을 주요 특징으로 짚음
- 다만 토큰을 적게 썼다고 실제 비용도 항상 가장 낮은 것은 아님
- 일반 모드에서는 API 단가 차이로 GPT-5.6 Sol보다 비용이 높았음
- 과목별 일괄 입력 모드에서는 Claude Opus 5와 Fable 5.1보다 낮은 비용으로 전체 풀이를 수행했다고 보고함
입력 방식에 따라 달라지는 성적
- 일반 모드는 필요한 지문과 문제를 한 문항씩 입력하는 방식
- 고난도 모드는 더 어려운 문제를 추가하는 것이 아니라, 같은 과목의 모든 문제를 한 번에 풀게 하는 방식
- 고난도 모드에서는 사회문화 8번 한 문항을 틀려 448.5점으로 GPT-5.6 Sol Pro와 같은 점수를 기록함
- 문제는 PDF에서 텍스트를 추출하고 오류를 수작업으로 수정한 뒤 입력하며, 수식은 LaTeX로 변환함
- 그래프와 도표는 이미지로 별도 첨부하며, 시험지 PDF 전체나 페이지 전체 캡처를 그대로 넣지는 않음
평가 조건과 주의사항
- Astra는 공식 API로 실행하며, 별도 시스템 프롬프트나 검색, 계산기 등 외부 도구를 제공하지 않음
- 추론 예산과 최대 출력 한도를 충분히 높게 설정하므로, 일반 웹/앱에서 사용하는 결과와는 다를 수 있음
- 온도와 Top P 등은 기본값을 사용해 실행마다 성적에 편차가 있을 수 있음
- 일부 비교 모델의 최고 추론 설정 점수는 낮은 설정에서 틀린 문항만 재평가한 결과이므로, 비교할 때 표시된 조건을 확인해야 함
- 실험 공개자도 Astra의 지식 컷오프가 시험 이후라는 점을 밝혔으며, 대시보드에는 문제 학습 가능성을 표시함
- 문제와 정답이 실제로 학습에 포함됐는지를 확인한 실험은 아니므로, 이 결과만으로 미학습 문제에서의 성능까지 판단하기는 어려움
관련 자료
- 실험 공개 글: 일반/고난도 모드 성적과 토큰 사용량, 비용 비교
- 성적 대시보드: 모델별 점수, 과목별 성적과 비용 분석
- 평가 방법과 공개 데이터: 입력 방식, 추론 설정과 비교 시 주의사항
댓글과 토론
이 글은 GeekNews 의 원문을 정제해 보여드립니다. 저작권은 원저작자에게 있습니다.
전체 내용이 궁금하다면
GeekNews 원문에서 이어 읽기




