[PyCon Korea 2025] PySpark Python UDF 2배 빠르게 만들기 - 권혁진
조회수 163회·8개월 전·20:53
한눈에 요약
자동 요약카테고리: 성능 / 최적화 발표소개: PySpark은 Pandas UDF와 Pandas Functions API 같은 Arrow 기반 API를 도입해 Python 작업을 더욱 빠르고 효율적으로 처리할 수 있게 되었습니다. 그럼에도 불구하고, 많은 사용자들은 여전히 간단한 사용 방식 때문에 일반 Python UDF를 주로…
타임라인
아직 이 영상의 타임라인을 분석하지 못했어요.
전체 영상은 YouTube 에서 볼 수 있어요.
영상 설명 원문 보기
카테고리: 성능 / 최적화 발표소개: PySpark은 Pandas UDF와 Pandas Functions API 같은 Arrow 기반 API를 도입해 Python 작업을 더욱 빠르고 효율적으로 처리할 수 있게 되었습니다. 그럼에도 불구하고, 많은 사용자들은 여전히 간단한 사용 방식 때문에 일반 Python UDF를 주로 사용하고 있으며, 이는 특히 Python 지식이 부족한 사용자의 경우에 경우에 더 두드러집니다. 이번 발표에서는 일반 Python UDF에도 Arrow 최적화를 적용할 수 있는 PySpark의 새로운 기능을 소개합니다. 기존 코드를 수정할 필요 없이, 설정 하나를 켜거나 UDF 단위의 옵션만 바꾸면 성능 향상을 바로 얻을 수 있습니다. 또한 Arrow 최적화된 Python UDF를 잘 활용하는 방법, 그리고 이 기능의 장점과 한계에 대해서도 실제 사용 팁과 함께 알아봅니다. PySpark를 처음 접하는 분이든, 이미 익숙한 사용자든, 이 세션을 통해 간단한 UDF 코드 그대로 더 나은 성능을 얻는 방법을 배워가실 수 있을 것입니다. ---- 권혁진 Databricks에서 오픈소스 PySpark 팀의 테크 리드로 활동 중인 Staff Software Engineer이며, Apache Software Foundation 멤버이자 Apache Spark PMC 멤버 및 커미터입니다. PySpark, Spark SQL, SparkR, 인프라 등 Apache Spark의 다양한 영역에서 기여하고 있으며, Apache Spark에서 가장 많은 커밋을 한 개발자입니다. Project Zen, Pandas API on Spark, Python Spark Connect 등 여러 주요 프로젝트를 주도하고 있습니다. 발표 자료 링크: https://s3.ap-northeast-2.amazonaws.com/pyconkr-backend-prod-public/public/%EA%B6%8C%ED%98%81%EC%A7%84_-_PySpark_Python_UDF_2%EB%B0%B0_%EB%B9%A0%EB%A5%B4%EA%B2%8C_%EB%A7%8C%EB%93%A4%EA%B8%B0.pdf