네이버 메인에 뉴시스 채널 추가하기!

서강대 인공지능학과 교수팀, '국제학술대회 COLM 2026' 논문 채택

등록 2026/09/29 10:50:16

COLM, 다음달 6일부터 미국 샌프란시스코서 개최

'가치 있는' 과거 경험 선별…AI 학습 효율 극대화

[서울=뉴시스] 장두성 서강대 인공지능학과 교수, 박현빈 인공지능학과 석사과정생. (사진=서강대 제공) 2026.09.29. photo@newsis.com *재판매 및 DB 금지

[서울=뉴시스] 장두성 서강대 인공지능학과 교수, 박현빈 인공지능학과 석사과정생. (사진=서강대 제공) 2026.09.29. [email protected] *재판매 및 DB 금지

[서울=뉴시스]이예인 인턴 기자 = 서강대학교는 장두성 인공지능학과 교수팀 소속 박현빈 석사과정생의 논문 '헤드룸-드리프트 리플레이(Headroom-Drift Replay)'가 '2026 언어모델링 콘퍼런스(COLM)’에 채택됐다고 29일 밝혔다.

COLM은 언어 모델의 학습·개선·분석을 다루는 국제학술대회다. 올해 행사는 다음달 6일부터 나흘간 미국 샌프란시스코에서 열리며, 사전·후속·강화학습 및 데이터 등과 관련한 연구 성과가 폭넓게 공유된다.

이번 연구는 대규모 언어 모델(LLM) 추론 능력 향상을 위한 강화학습에서 기존 경험을 재활용해 효율을 높이는 방법을 다룬다.

기존 모델은 학습할 때마다 새로운 응답이나 문제 해결 과정을 반복 생성해 많은 비용과 시간이 필요했다.

논문에서 제안한 '헤드룸-드리프트 리플레이' 기법은 과거 데이터를 단순 재사용하는 것이 아닌 가치가 충분한 경험인지(헤드룸)와 안정적으로 활용 가능한 경험인지(폴리시 드리프트)를 고려해 재사용할 데이터를 선별한다.

수학 추론, 멀티모달 추론 등 다양한 환경에서 실험한 결과, 제안한 방법은 단순 재사용 방식보다 일관된 높은 성능을 보였다. 보다 복잡한 기존 리플레이(Replay) 학습 방식과 비교해서도 동등하거나 우수한 성능을 기록했다.

외부와 반복적으로 상호작용하는 에이전틱 서치(Agentic Search) 환경에서는 새로운 데이터 생성 방식보다 높은 성능을 보이면서도 학습 단계당 소요 시간을 줄여, LLM 강화학습 성능·효율성을 동시 개선할 수 있음을 확인했다.

연구팀은 "데이터 생성 비용을 줄이면서 유용한 경험을 선별할 수 있음을 확인했다"며 "향후 다양한 강화학습 환경과 LLM에 적용해 더욱 효율적인 AI 모델 학습 기술로 발전해 나갈 것으로 기대한다"고 말했다.

◎공감언론 뉴시스 yein020528

Copyright © NEWSIS.COM, 무단 전재 및 재배포 금지

글자크기 설정

상단으로 이동
로딩중로딩아이콘

URL이 성공적으로 복사되었습니다.