한국정보기술진흥원2026 제7회 청소년 IT경시대회 개최안내

CUDA-L2, 강화학습으로 NVIDIA cuBLAS 성능 뛰어넘어...A100 GPU에서 뛰어난 최적화 성능 입증

thumbnail.webp
대규모 언어모델과 강화학습 결합한 자동 최적화 시스템, NVIDIA 상용 라이브러리 대비 일관된 속도 향상 달성
[한국정보기술신문] 인공지능 스타트업 딥리인포스AI가 개발한 CUDA-L2 시스템이 NVIDIA의 상용 행렬 연산 라이브러리인 cuBLAS의 성능을 체계적으로 넘어서는 결과를 공개했다. 이 시스템은 대규모 언어모델과 강화학습을 결합해 CUDA 커널을 자동으로 최적화하는 혁신적인 접근법을 사용한다.
CUDA-L2는 반정밀도 일반 행렬 곱셈 연산을 위한 CUDA 커널을 자동으로 최적화하는 시스템으로, 지난 12월 2일 A100 GPU에 최적화된 1000개 구성의 HGEMM 커널을 공개했다. 연구팀은 논문을 통해 CUDA-L2가 널리 사용되는 torch.matmul부터 NVIDIA의 최신 비공개 라이브러리인 cuBLAS, cuBLASLt-heuristic, cuBLASLt-AutoTuning에 이르기까지 주요 행렬 곱셈 기준선들을 일관되게 능가한다고 밝혔다.

1000개 구성에서 일관된 성능 우위 확인

연구팀이 A100 GPU에서 1000개의 서로 다른 (M,N,K) 행렬 구성을 대상으로 실시한 벤치마크 결과, CUDA-L2는 모든 비교 대상보다 빠른 실행 속도를 기록했다. 특히 NVIDIA의 상용 솔루션인 cuBLAS와 cuBLASLt의 휴리스틱 및 자동 튜닝 버전과 비교해서도 지속적인 속도 향상을 보여줬다.
이러한 성능 개선은 대규모 언어모델의 추론 능력과 강화학습의 최적화 능력을 결합한 독특한 접근 방식에서 비롯된다. 시스템은 주어진 하드웨어 환경과 행렬 크기에 최적화된 커널을 자동으로 생성하고 튜닝할 수 있다.

오픈소스 공개로 연구 생태계 활성화 기대

딥리인포스AI는 GitHub를 통해 CUDA-L2의 소스코드와 사전 최적화된 커널을 공개했다. 프로젝트는 Python과 PyTorch 2.6.0 이상 버전, NVIDIA CUTLASS v4.2.1을 기반으로 구축되었으며, A100 아키텍처를 대상으로 한다.
연구팀은 현재 16비트 누산기를 사용하는 HGEMM만 지원하지만, 향후 32비트 누산기 지원, 더 조밀한 행렬 구성, RTX 3090이나 H100 같은 다른 GPU 아키텍처로의 확장을 계획하고 있다. 또한 오픈소스 대규모 언어모델에 쉽게 배포할 수 있는 방안도 준비 중이다.

실용성 고려한 다양한 실행 모드 제공

CUDA-L2는 오프라인 배치 처리 모드와 서버 모드를 모두 지원한다. 사용자는 워밍업 시간, 벤치마크 지속 시간, GPU 장치 ID 등을 지정할 수 있으며, 서버 모드에서는 초당 쿼리 수를 설정해 요청 기반 시나리오를 시뮬레이션할 수 있다.
연구팀은 사용자가 필요로 하는 행렬 차원이 사전 최적화된 구성에 없을 경우, 가장 가까운 구성을 찾아 0으로 패딩하거나 GitHub 이슈를 통해 해당 구성의 커널 제공을 요청할 수 있다고 안내했다. 문의사항은 jiwei_li@deep-reinforce.com으로 연락하면 된다.

행렬 연산 최적화의 새로운 패러다임 제시

이번 연구는 GPU 연산 최적화 분야에서 인공지능 기술이 전통적인 수작업 최적화나 휴리스틱 기반 접근법을 넘어설 수 있음을 보여준다. 행렬 곱셈은 딥러닝 모델의 학습과 추론에서 가장 많은 연산 시간을 차지하는 핵심 연산으로, CUDA-L2의 성능 개선은 인공지능 워크로드 전반의 효율성 향상으로 이어질 수 있다.
연구팀은 향후 더 다양한 GPU 아키텍처와 행렬 구성을 지원하며, 실제 프로덕션 환경에서의 적용성을 높여나갈 계획이다. 관련 논문은 arXiv에 공개되었으며, 소스코드는 GitHub의 deepreinforce-ai/CUDA-L2 저장소에서 확인할 수 있다.
한국정보기술신문 인공지능분과 김주호 기자 news@kitpa.org

함께 읽으면 좋은 기사

2026 하계 대학생 IT논문경진대회 결과 발표...고려대 이동근 팀·대구한의대 조소혜 팀 대상, 우수 논문 16개 팀에 대상 2·금상 6·은상 8 수여

2026 하계 대학생 IT논문경진대회 결과 발표...고려대 이동근 팀·대구한의대 조소혜 팀 대상, 우수 논문 16개 팀에 대상 2·금상 6·은상 8 수여

교육 · 인공지능 · 디지털인문학 5
2026 하계 청소년 IT학술대회 본선 23개 팀 수상...충남과학고 성지원·고색고 최우석 대상, 초등 6학년부터 고3까지 참여

2026 하계 청소년 IT학술대회 본선 23개 팀 수상...충남과학고 성지원·고색고 최우석 대상, 초등 6학년부터 고3까지 참여

교육 · 인공지능 · 디지털인문학 5
SK하이닉스, FMS 2026서 '계층형 메모리' 기반 차세대 AI 인프라 해법 제시...샌디스크와 HBF 첫 표준 규격 공개, 375단 4D 낸드 웨이퍼도 첫선

SK하이닉스, FMS 2026서 '계층형 메모리' 기반 차세대 AI 인프라 해법 제시...샌디스크와 HBF 첫 표준 규격 공개, 375단 4D 낸드 웨이퍼도 첫선

반도체 4
SK하이닉스, 용인·청주 신규 팹에 54조원 투자 결정...7일 이사회 의결, 용인 Y2에 35조2000억원·청주 M17에 19조1000억원, D램과 낸드 생산 거점 동시 확충

SK하이닉스, 용인·청주 신규 팹에 54조원 투자 결정...7일 이사회 의결, 용인 Y2에 35조2000억원·청주 M17에 19조1000억원, D램과 낸드 생산 거점 동시 확충

반도체 4
네팔 정부, 유출 계정 조회 서비스 HIBP에 47번째로 합류...국가사이버보안센터, 정부 도메인 이메일 유출 상시 감시 나서

네팔 정부, 유출 계정 조회 서비스 HIBP에 47번째로 합류...국가사이버보안센터, 정부 도메인 이메일 유출 상시 감시 나서

정보보안 3
깃허브 액션 8시간 44분 장애 끝에 복구...웹훅 85% 차단하며 밀린 작업 처리했다...한국시간 7일 오전 0시 22분 시작, 오전 9시 6분 완화 선언, 러너에 만료된 작업이 배정되는 오류가 원인, 페이지스·코파일럿 서비스도 함께 영향

깃허브 액션 8시간 44분 장애 끝에 복구...웹훅 85% 차단하며 밀린 작업 처리했다...한국시간 7일 오전 0시 22분 시작, 오전 9시 6분 완화 선언, 러너에 만료된 작업이 배정되는 오류가 원인, 페이지스·코파일럿 서비스도 함께 영향

정보기술 4
미 NSF, 1억 달러 규모 'AI 인프라 허브' 사업 착수...엔비디아·AMD·인텔 등 민간 참여...최대 10개 지역 컨소시엄 선정, 대학 간 AI 연구 격차 해소 겨냥

미 NSF, 1억 달러 규모 'AI 인프라 허브' 사업 착수...엔비디아·AMD·인텔 등 민간 참여...최대 10개 지역 컨소시엄 선정, 대학 간 AI 연구 격차 해소 겨냥

인공지능 4
미 뉴멕시코 법원, 메타에 5억6700만 달러 추가 부담 명령...아동 정신건강 기금 조성하고 미성년자 이용 시간도 월 90시간으로 제한

미 뉴멕시코 법원, 메타에 5억6700만 달러 추가 부담 명령...아동 정신건강 기금 조성하고 미성년자 이용 시간도 월 90시간으로 제한

방송통신 5
삼성전자, 런던서 '갤럭시 커뮤니티 커넥트' 개최...17개국 고객 51명 언팩 현장 참관

삼성전자, 런던서 '갤럭시 커뮤니티 커넥트' 개최...17개국 고객 51명 언팩 현장 참관

정보기술 3
농촌진흥청, 세계식육과학기술대회 16년 만에 한국 개최...50개국 전문가 1,000여 명, 9~14일 대전서 AI 스마트공장·지속가능성 논의

농촌진흥청, 세계식육과학기술대회 16년 만에 한국 개최...50개국 전문가 1,000여 명, 9~14일 대전서 AI 스마트공장·지속가능성 논의

유관기관 3
AMD, AI 모델을 반도체에 새기는 스타트업 '탈라스' 인수...메모리 없이 가중치를 실리콘에 직접 각인, 초당 1만7000토큰 시제품으로 엔비디아 추론 시장 정조준

AMD, AI 모델을 반도체에 새기는 스타트업 '탈라스' 인수...메모리 없이 가중치를 실리콘에 직접 각인, 초당 1만7000토큰 시제품으로 엔비디아 추론 시장 정조준

반도체 · 인공지능 4
엔비디아, 개방형 '월드 모델'로 물리 AI 생태계 확장...로봇·자율주행·비전 AI 겨냥한 코스모스 3, 640억~40억 매개변수 3종으로 공개...삼성전자·LG전자·두산로보틱스 등 활용

엔비디아, 개방형 '월드 모델'로 물리 AI 생태계 확장...로봇·자율주행·비전 AI 겨냥한 코스모스 3, 640억~40억 매개변수 3종으로 공개...삼성전자·LG전자·두산로보틱스 등 활용

인공지능 · 반도체 · 정보통신 4