본문으로 건너뛰기
발표 영상 목록으로

[PyCon Korea 2025] VLM, 눈 달린 LLM을 만나보자! - 김대현

조회수 532·8개월 전·31:16

한눈에 요약

자동 요약

카테고리: 인공지능 발표 소개: 요즘 우리는 LLM을 많이 활용하면서 Text (Prompt)로 LLM에 Question & Answering을 하면서 질문하고 답을 받는 방식에 대하여 익숙해 졌습니다. 하지만, 많은 LLM에 사진(시각 정보)를 첨부해 Question을 던지면, 모델이 Text와 이미지를 모두 이해해…

타임라인

아직 이 영상의 타임라인을 분석하지 못했어요.
전체 영상은 YouTube 에서 볼 수 있어요.

YouTube 에서 전체 보기 ↗
영상 설명 원문 보기
카테고리: 인공지능

발표 소개: 
요즘 우리는 LLM을 많이 활용하면서 Text (Prompt)로 LLM에 Question & Answering을 하면서 질문하고 답을 받는 방식에 대하여 익숙해 졌습니다.

하지만, 많은 LLM에 사진(시각 정보)를 첨부해 Question을 던지면, 모델이 Text와 이미지를 모두 이해해 답변을 내놓는 경험도 손쉽게 할수 있습니다.

이러한 LLM이 시각, 언어 동시 처리 능력을 가질수 있는 기술이 바로 VLM (Vision Language Model)이라는 기술인데, 텍스트 기반 LLM만큼 널리 알려져 있지 않는거 같았습니다.

그래서 이번 세션에서 VLM이 어떠한 원리로 동작이 되고, 실제로 어떻게 활용할수 있는지를 저의 VLM 기반 발표 피드백 Agent를 개발했던 경험을 토대로 한번 소개하는 세션을 진행해보고자 합니다.

--
김대현
기술과 데이터를 통해 더 나은 세상을 만들기 위해 열심히 구르는중입니다. 🐤

Github: https://github.com/Daehyun-Bigbread
LinkedIn: https://www.linkedin.com/in/daehyun-kim-b6336b291/
Instagram: https://www.instagram.com/developer._.toby

kakaostyle Data Quailty Manager
Google Developer Groups Organizer (Campus Korea)
Pycon Korea 2024 발표

발표 자료 링크: https://s3.ap-northeast-2.amazonaws.com/pyconkr-backend-prod-public/public/%EA%B9%80%EB%8C%80%ED%98%84_-_VLM%2C_%EB%88%88_%EB%8B%AC%EB%A6%B0_LLM%EC%9D%84_%EB%A7%8C%EB%82%98%EB%B3%B4%EC%9E%90%21.pdf