강연요약

2026 강연요약

기조강연 #1 · 9월 17일 11:30-12:10

모델 정확도 1% 너머의 AI: 기업에서 AI 기술을 만들고 활용하는 방법

강연 요약

본 강연에서는 AI 모델의 정확도를 높이는 연구를 넘어, 기업이 기술을 실제 서비스로 구현하고 지속적으로 운영하는 과정에 대해 다룬다. 음성·영상 등의 AI 기술이 연구 단계에서 상용 서비스로 발전하기까지 필요한 데이터, 모델, 시스템 및 서비스 설계 관점을 살펴본다.

특히 글로벌 범용 모델과 차별화되는 한국어 특화 서비스의 개발 방향과 활용 가능성을 소개한다. 에이닷 통화요약과 같은 대규모 서비스에서 음성인식과 생성형 AI 기술이 어떻게 결합되고 운영되는지 설명하고, 고객센터 AICC 사례를 통해 실시간성, 인식 성능, 응답 품질, 비용 및 시스템 안정성 간의 현실적인 균형을 살펴본다.

또한 의료비 청구 문서 OCR, 반도체 기술문서 이해 등 산업별 요구사항에 최적화된 특화 모델의 개발 사례를 공유한다. 상용화 과정에서 중요한 예외 상황, 지연시간, 추론 비용, 개인정보 보호, 장애 대응을 살펴보며 좋은 AI 연구를 실제로 사용되는 기술과 서비스로 전환하기 위한 기업의 개발 방식과 문제 해결 관점을 전달한다.

연사 약력

학력
University of Wisconsin-Madison Electrical & Computer Engineering 석사
한양대학교 전기공학과 학사

경력
2013-현재 SK텔레콤
2005-2013 삼성종합기술원

주요 활동
한국지능정보사회진흥원 평가위원
한국인공지능협회 기업 특별회원

기조강연 #2 · 9월 17일 13:50-14:20

Signal from Noise: AI 시대에 다시 보는 DSP

강연 요약

오늘날 인공지능 응용의 상당 부분은 영상, 음성 및 시계열과 같은 디지털 신호를 다룬다. 본 강연에서는 적응필터의 LMS 알고리즘과 backpropagation, CELP 음성 부호화와 diffusion 생성모델, perfect-reconstruction filter bank와 CNN encoder-decoder 구조를 나란히 살펴보며 현대 AI 신호처리의 여러 개념이 전통적인 DSP의 문제의식과 구조를 통해 더욱 명확하게 이해될 수 있음을 설명한다.

공개 코드와 사전학습 모델의 발전으로 DSP를 깊이 알지 못해도 새로운 모델을 실행하고 실험할 수 있게 되었지만, 결과를 해석하고 실패 원인을 진단하며 비트율, 지연, 전력, 메모리, 안정성 및 표준 호환성의 제약을 만족하는 실제 시스템을 개발하기 위해서는 sampling, spectrum, filtering, prediction, multirate processing, quantization, rate-distortion 및 human perception에 대한 이해가 여전히 필요하다.

방송 중계, 음성·영상 코덱과 소비자 전자제품 사례를 통해 딥러닝과 전통 DSP가 경쟁 관계가 아니라 상호 보완적인 도구임을 살펴보고, AI 시대의 연구자 역할과 DSP 교육 방향을 논의한다.

연사 약력

학력
서울대학교 제어계측공학과 학사·석사·박사

경력
1999-현재 서울대학교 전기·정보공학부 교수
2026-현재 스누아이랩 R&D센터장
1994-1998 서울시립대학교 전자전기공학부 조교수

주요 활동
대한전자공학회 신호처리소사이어티 회장
한국방송·미디어공학회 회장
IEEE Transactions on Image Processing Associate Editor

튜토리얼 #1 · 9월 17일 15:00-15:45

Robot Foundation Models Beyond Robot Data

강연 요약

Robot foundation models generalize across diverse manipulation tasks, yet their progress remains bound by robot demonstrations that are expensive to collect and difficult to scale. Data beyond the robot itself, such as human and web-scale videos, offers a promising alternative source of embodied knowledge. This talk covers the basics of robot foundation models and reviews representative approaches that incorporate such data at different stages, including representation learning, demonstration conditioning, and test-time adaptation. We then discuss recent efforts on leveraging these sources for robots.

연사 약력

학력
KAIST 전기및전자공학부 석박사통합과정
KAIST 전기및전자공학부 학사

경력
2022-현재 NAVER AI Lab Research Scientist
2021-2022 Qualcomm Research Intern
2019 KAKAO Research Intern

튜토리얼 #2 · 9월 17일 15:45-16:30

Video Generation and World Models

강연 요약

최근 Video Generative Model 및 World Model의 성능은 나날이 발전하고 있으며, 단순히 비디오를 생성하는 것을 넘어 Action을 받거나 생성할 수 있는 모델로 확장되고 있다. 본 튜토리얼에서는 최근 Video Generative Model과 World Model의 동향 및 도전 과제를 논의한다. 또한 실제 Metropolis를 조건으로 받을 수 있는 Seoul World Model에 대해 살펴본다.

연사 약력

학력
연세대학교 전기전자공학과 학사·박사

경력
2024-현재 KAIST AI대학원 부교수
2020-2024 고려대학교 컴퓨터학과 부교수
2019-2020 EPFL 박사후연구원

신진연구자발표 #1 · 9월 18일 10:00-11:00

Toward Human-like Conversation: Giving Voice and Face to AI

강연 요약

거대 언어 모델(LLM)의 등장은 인간-기계 간의 자유로운 소통을 가능하게 하며 인류의 삶에 혁신적인 변화를 가져왔다. 그러나 현재의 LLM은 주로 텍스트 기반의 소통에 국한되어 있으며, 진정한 의미의 인간다운 소통은 그 이상의 영역에 존재한다. 인간의 직관적인 소통 방식이 청각과 시각 정보에 기초한다는 사실에 주목하여, 본 강연에서는 인간다운 소통을 위한 핵심 요소 기술인 음성 및 얼굴 생성 기술을 소개한다.

연사 약력

학력
한국과학기술원 전기및전자공학부 박사
고려대학교 인공지능학과 석사
경희대학교 수학과 학사

경력
2026-현재 중앙대학교 첨단영상대학원 조교수
2022-2023 현대자동차/42dot 연구원

주요 활동
Interspeech, ICASSP, CVPR, ICML, AAAI, NeurIPS Reviewer

신진연구자발표 #1 · 9월 18일 10:00-11:00

Closing the Loop of Alignment in Generative AI

강연 요약

This talk frames recent progress in generative AI as a shift from learning powerful priors to closing an alignment loop around them. By formulating alignment mathematically, we show how post-training via reinforcement learning and inference-time guidance can be understood within a unified framework. We identify three core components that enable alignment and argue that closing the loop often requires improving the weakest component: the design of rewards, verifiers, or evaluation criteria. We illustrate this perspective through results in video generation and understanding, as well as applications to inverse problems and medical imaging. The talk concludes by showing how the same alignment-loop perspective naturally extends to agents and by discussing future directions for building more capable and reliable generative systems.

연사 약력

학력
KAIST 바이오및뇌공학과 박사·석사
고려대학교 바이오의공학부 학사

경력
2026-현재 고려대학교 컴퓨터학과 조교수
2025-현재 EverEx Chief Research Officer
NVIDIA Research, Google Research, Los Alamos National Laboratory Research Intern

신진연구자발표 #1 · 9월 18일 10:00-11:00

Multimodal Alignment for Video Understanding

강연 요약

This talk explores various multimodal alignment techniques for video understanding. First, we explore Dense Video Captioning, where we go from input videos to natural language captions to understand how video models process videos. Then, we explore multi-moment Video Temporal Grounding to understand how video models can take a given video and text query to capture moments in the video.

연사 약력

학력
KAIST 전기및전자공학부 박사
Georgia Institute of Technology 전기컴퓨터공학부 학사

경력
2026-현재 건국대학교 전기전자공학부 조교수
2024-2026 세종대학교 인공지능데이터사이언스학과 조교수
2023-2024 KAIST 박사후연구원

신진연구자발표 #2 · 9월 18일 11:10-12:10

Towards Efficient AI Agents: Scaling Down Costs from Model to Agent Level

강연 요약

While AI agents have achieved remarkable autonomy, their deployment remains bottlenecked by prohibitive computational overhead and token costs across the entire execution pipeline. In this talk, I present a holistic, three-layer efficiency framework designed to scale down these operational costs without sacrificing performance. At the Model Level, we mitigate visual processing overhead via Training-Free Token Pruning via Zeroth-Order Gradient Estimation, which removes token redundancy in VLMs without costly retraining. At the Reasoning Level, we address the compute burden of extended multi-step inference through VisRef, a dynamic visual refocusing strategy that optimizes test-time scaling in multimodal reasoning models. Finally, at the Agent/Harness Level, we present SkillRet, a large-scale benchmark that enables precise skill retrieval and efficient context injection to streamline tool selection over vast action spaces. Together, these contributions outline a comprehensive roadmap toward lightweight, scalable, and cost-effective AI agent systems.

연사 약력

학력
Yale University Electrical Engineering 박사
KAIST Electrical Engineering 석사
서강대학교 전자공학과 학사

경력
2026-현재 고려대학교 전기전자공학부 조교수
2025-2026 Amazon AWS AI Labs Applied Scientist
2024-2025 Meta Reality Labs Machine Learning Research Scientist

주요 활동
CVPR, ICCV, ECCV, NeurIPS, ICML, ICLR 및 IEEE 주요 저널 Reviewer
2022 ACM/IEEE ISLPED Best Paper Award

신진연구자발표 #2 · 9월 18일 11:10-12:10

고정된 범주를 넘어 인간의 언어로: 3D 의료 영상 진단 AI의 진화

강연 요약

CT, MRI 등 3D 의료 영상은 인체 내부 구조를 입체적으로 파악하는 데 유용하나, 방대한 시각 정보량으로 인해 미세 병변 감지 시 의료진을 보조할 AI의 역할이 강조되고 있다. 기존의 3D 의료 영상 AI는 주로 사전에 정의된 질환을 분류하거나 특정 장기 및 종양을 분할하는 고정된 범주 예측 모델에 집중해 왔다. 그러나 이러한 방식은 학습되지 않은 질환에 유연하게 대응하기 어렵고, 임상 현장의 복잡한 소견을 온전히 반영하는 데 한계가 있다.

최근 대형 언어 모델과 비전-언어 모델의 발전은 이러한 한계를 극복하는 새로운 패러다임을 제시한다. 최신 의료 AI는 고정된 범주의 진단을 넘어 자유 언어를 이해하고 영상과 복합적으로 추론하는 언어 주도형 의료 진단으로 진화하고 있다.

본 강연에서는 이러한 3D 의료 영상 분석 분야의 변화를 설명하고, 시각 정보와 인간의 언어를 융합하여 텍스트 프롬프트 기반으로 병변을 특정하는 3D Visual Grounding 등 언어 주도형 진단의 최신 연구 결과를 소개한다.

연사 약력

학력
고려대학교 전기전자공학과 박사
고려대학교 전기전자전파공학부 학사

경력
2025-현재 가천대학교 인공지능학과 조교수
2022-2024 고려대학교 정보통신기술연구소 연구교수

튜토리얼 #3 · 9월 18일 13:30-14:15

3차원 사람 메쉬 복원 방법: 기초부터 스마트 안경 응용까지

강연 요약

본 강연에서는 단일 RGB 영상부터 머리 자세까지 다양한 입력 데이터를 기반으로 3차원 사람 메쉬를 복원하는 방법을 소개한다. 특히 가려짐이나 전역적 움직임에 강인한 최신 방법들을 심도 있게 살펴본다. 또한 최신 스마트 안경을 기반으로 한 3차원 공간 이해 및 상호작용을 위해 필수적인 기술로, 자기중심적 입력 영상을 이용하여 사용자 전신의 메쉬까지 복원하는 방법을 알아본다.

연사 약력

학력
KAIST 전기및전자공학과 공학박사

경력
2016-현재 건국대학교 전기전자공학부 교수
2012-2016 삼성종합기술원 전문연구원

주요 활동
대한전자공학회 상임이사
한국컴퓨터비전학회 상임이사
한국방송·미디어공학회 상임이사