[PyCon Korea 2025] 고등학생이 만들어 본 LLM-as-a-judge 번역 벤치마크 리더보드 - 심기현
조회수 341회·8개월 전·길이 미제공
타임라인
아직 이 영상의 타임라인을 분석하지 못했어요.
전체 영상은 YouTube 에서 볼 수 있어요.
영상 설명 원문 보기
카테고리: 인공지능 발표소개: "어떤 번역기가 정말 좋은 번역을 할까?"라는 질문에 답하기 위해 시작한 프로젝트입니다. 기존 평가 지표(BLEU)의 한계를 넘어, AI가 번역의 의미와 문맥을 직접 평가하는 'LLM-as-a-judge' 방식을 도입했습니다. 속담, 신조어 등 번역하기 까다로운 문장들로 데이터셋을 구축하고 , Claude 3.7 Sonnet을 AI 심판으로 삼아 파파고, DeepL, GPT 등 17종의 번역기를 평가했습니다. 리버스 엔지니어링을 포함하여 전체 평가 과정을 자동화하는 Python CLI 툴 개발기를 공유합니다. 어떤 번역기가 번역을 잘 할까요? ---- 심기현 여러 분야에 도전하는 학생 개발자 Interested in: LLM & AI, Backend, Server, Web 발표 자료 링크: https://s3.ap-northeast-2.amazonaws.com/pyconkr-backend-prod-public/public/%EC%8B%AC%EA%B8%B0%ED%98%84_-_%EA%B3%A0%EB%93%B1%ED%95%99%EC%83%9D%EC%9D%B4_%EB%A7%8C%EB%93%A4%EC%96%B4_%EB%B3%B8_LLM-as-a-judge_%EB%B2%88%EC%97%AD_%EB%B2%A4%EC%B9%98%EB%A7%88%ED%81%AC_%EB%A6%AC%EB%8D%94%EB%B3%B4%EB%93%9C.pdf