한국정보기술진흥원한국인공지능올림피아드 (KOAI) 2026 개최안내

구글, 노트북서 구동되는 멀티모달 AI '젬마 4 12B' 공개...인코더 없는 통합 구조로 음성·이미지 직접 처리

구글이 16GB 메모리로 작동하는 멀티모달 AI '젬마 4 12B'를 공개했다.
[한국정보기술신문] 구글이 노트북 등 일반 소비자용 기기에서 직접 구동할 수 있는 멀티모달 인공지능(AI) 모델 '젬마 4 12B(Gemma 4 12B)'를 지난 3일(현지시간) 공개했다. 이 모델은 별도의 인코더 없이 음성과 이미지를 직접 처리하는 통합 구조를 채택해, 적은 메모리만으로도 고성능 추론을 수행할 수 있는 것이 특징이다.
젬마 4 12B는 구글 딥마인드가 개발한 오픈소스 모델로, 기존 경량 모델인 E4B와 고성능 모델인 26B 전문가 혼합(MoE) 모델 사이의 공백을 메우기 위해 설계됐다. 구글은 이 모델이 강력한 성능을 갖추면서도 메모리 사용량을 줄였으며, 중간 규모 모델 중 처음으로 음성 입력을 자체적으로 지원한다고 설명했다.
올리비에 라콩브 구글 딥마인드 제품 관리 담당 디렉터와 구스 마르틴스 제품 관리자는 블로그를 통해 "젬마 4 12B는 모바일 환경에 최적화된 효율성과 고급 추론 능력을 결합해 고성능 멀티모달 지능을 노트북에 직접 구현하도록 설계됐다"고 밝혔다.
Hero_Visual_G4_12B_1.width-1200.format-webp.webp
구글 제공

인코더 없앤 통합 구조로 메모리 부담 줄여

젬마 4 12B의 가장 큰 특징은 시각·음성 정보를 처리하는 방식이다. 기존 멀티모달 모델은 이미지와 음성을 언어 모델에 전달하기 전에 이를 변환하는 별도의 인코더를 사용해 왔다. 그러나 이 같은 인코더는 지연 시간을 늘리고 메모리 사용량을 증가시키는 단점이 있다.
구글은 이러한 문제를 해결하기 위해 젬마 4 12B를 인코더가 없는 구조로 학습시켰다. 시각 정보 처리의 경우 기존 시각 인코더를 단일 행렬 곱셈과 위치 임베딩, 정규화로 구성된 가벼운 임베딩 모듈로 대체했다. 음성 처리는 더 단순화해 인코더를 완전히 제거하고, 음성 신호를 텍스트 토큰과 동일한 차원의 공간으로 직접 변환하도록 했다.
이를 통해 시각·음성 입력이 언어 모델의 중심부로 곧바로 흘러 들어가는 구조가 완성됐다. 구글은 이러한 설계가 일상적인 하드웨어에서도 속도나 추론 능력을 떨어뜨리지 않으면서 고급 멀티모달 기능을 제공한다고 강조했다.

26B 모델 근접 성능...16GB 메모리로 로컬 구동

성능 면에서 젬마 4 12B는 표준 벤치마크 기준으로 더 큰 26B MoE 모델에 근접한 성능을 보이면서도, 전체 메모리 사용량은 절반 이하에 그친다. 16기가바이트(GB)의 램(RAM)이나 통합 메모리만 갖춘 소비자용 노트북에서도 로컬로 구동할 수 있어, 사용자의 기기에서 직접 멀티모달 및 에이전트 기능을 활용할 수 있다.
별도의 서버나 클라우드에 연결하지 않고 기기 자체에서 AI를 실행하는 이른바 '온디바이스 AI'는 응답 속도가 빠르고 데이터가 외부로 전송되지 않아 보안과 개인정보 보호 측면에서 유리하다는 평가를 받는다. 젬마 4 12B는 이러한 흐름에 맞춰 고성능 모델을 개인 기기 수준으로 끌어내린 사례로 볼 수 있다.
또한 젬마 4 12B는 지연 시간을 줄이기 위한 다중 토큰 예측(MTP) 드래프터를 기본 탑재했다. 모델은 아파치 2.0 라이선스로 공개돼 개발자들이 자유롭게 내려받아 활용하고 미세 조정할 수 있다.

젬마 4 다운로드 1억5천만 건 돌파

구글에 따르면 젬마 4 모델은 현재까지 누적 다운로드 1억5천만 건을 넘어섰다. 개발자 커뮤니티는 이 모델을 활용해 신체 보조용 웨어러블 로봇 팔부터 기업용 AI 보안 솔루션까지 다양한 결과물을 만들어 왔다.
젬마 4 12B는 LM 스튜디오와 올라마(Ollama), 구글 AI 엣지 갤러리 앱 등에서 곧바로 체험할 수 있다. 사전 학습 및 명령어 튜닝 모델의 가중치는 허깅페이스와 캐글에서 내려받을 수 있으며, 허깅페이스 트랜스포머스와 llama.cpp, vLLM 등 주요 개발 도구와도 연동된다. 운영 환경에서는 구글 클라우드의 모델 가든과 클라우드 런, 구글 쿠버네티스 엔진(GKE)을 통해 배포할 수 있다.
구글은 에이전트 개발을 지원하기 위해 젬마 모델용 공식 '스킬 저장소(Skills Repository)'도 함께 공개했다. 이는 AI 에이전트가 젬마 모델을 기반으로 다양한 작업을 수행할 수 있도록 돕는 기능 모음이다.
한국정보기술신문 인공지능분과 박연호 기자 news@kitpa.org

함께 읽으면 좋은 기사

GPT-5.6, 마침내 일반 공개...Codex와 통합된 새 '슈퍼 앱' 선보여...

GPT-5.6, 마침내 일반 공개...Codex와 통합된 새 '슈퍼 앱' 선보여...

인공지능 4
삼성 노태문 사장 "가장 중요한 AI는 나를 가장 잘 아는 AI"...22일 언팩 앞두고 AI 철학 밝혀...에이전틱 AI 시대 '사람에 대한 이해'와 개방·신뢰 강조하며 갤럭시 새 폴더블 예고

삼성 노태문 사장 "가장 중요한 AI는 나를 가장 잘 아는 AI"...22일 언팩 앞두고 AI 철학 밝혀...에이전틱 AI 시대 '사람에 대한 이해'와 개방·신뢰 강조하며 갤럭시 새 폴더블 예고

정보기술 · 인공지능 4
EU 의회, 4월 만료된 '사적 메시지 검사법' 되살릴지 9일 표결...한 시민단체 정보 페이지가 정리...이례적 '긴급 절차'로 부활 시도에 반발, 상시 규제 '2.0'은 암호화 놓고 교착

EU 의회, 4월 만료된 '사적 메시지 검사법' 되살릴지 9일 표결...한 시민단체 정보 페이지가 정리...이례적 '긴급 절차'로 부활 시도에 반발, 상시 규제 '2.0'은 암호화 놓고 교착

정보보안 4
구글 참여 'AI 산불 감시 위성' 파이어샛 3기 발사...5m 크기 불씨까지 잡아낸다...비영리 '지구화재동맹'·뮤온스페이스와 구축, 시범위성 1년 성과 딛고 상시 운영 체제로 전환

구글 참여 'AI 산불 감시 위성' 파이어샛 3기 발사...5m 크기 불씨까지 잡아낸다...비영리 '지구화재동맹'·뮤온스페이스와 구축, 시범위성 1년 성과 딛고 상시 운영 체제로 전환

인공지능 4
아바타 세계 첫 국제 표준 나왔다...일본 주도로 'ISO/IEC 24216-1' 발행...형태 통일 아닌 '공통 용어' 규정, 아바타 정의·분류·신체소유감·윤리 배려 담아

아바타 세계 첫 국제 표준 나왔다...일본 주도로 'ISO/IEC 24216-1' 발행...형태 통일 아닌 '공통 용어' 규정, 아바타 정의·분류·신체소유감·윤리 배려 담아

실감형콘텐츠 5
오픈AI 'GPT-5.6 솔·테라·루나' 목요일 일반 공개...미국 정부, 광범위한 출시 승인...한 달여간 정부 승인 대상에만 열렸던 '단계적 공개' 제한 풀려, 프리뷰 접근도 전 세계로 확대

오픈AI 'GPT-5.6 솔·테라·루나' 목요일 일반 공개...미국 정부, 광범위한 출시 승인...한 달여간 정부 승인 대상에만 열렸던 '단계적 공개' 제한 풀려, 프리뷰 접근도 전 세계로 확대

인공지능 4
플레이스테이션, 3년 안 쓰면 계정과 디지털 게임 삭제할 수 있다...유럽 약관에 '36개월 미사용 시 계정 폐쇄' 명시, 2028년 실물 디스크 중단 발표 직후 알려져 이용자 반발 커져

플레이스테이션, 3년 안 쓰면 계정과 디지털 게임 삭제할 수 있다...유럽 약관에 '36개월 미사용 시 계정 폐쇄' 명시, 2028년 실물 디스크 중단 발표 직후 알려져 이용자 반발 커져

실감형콘텐츠 4
제3회 국제인공지능올림피아드 한국대표단 선발 완료...7월 24일 서울시청서 발대식 연다...고교생 국가대표 4명·예비 1명 확정, 8월 카자흐스탄 아스타나 본선 출전

제3회 국제인공지능올림피아드 한국대표단 선발 완료...7월 24일 서울시청서 발대식 연다...고교생 국가대표 4명·예비 1명 확정, 8월 카자흐스탄 아스타나 본선 출전

보도자료 · 인공지능 · 교육 3
엔비디아 오픈 모델, 세계 AI 연구의 토대 되다...ICML 2026서 '네모트론' 인용 논문 145편...로봇 월드 모델·생명과학·합성 데이터로 확산, 네이버·머크·사카나AI 등 생태계도 성장

엔비디아 오픈 모델, 세계 AI 연구의 토대 되다...ICML 2026서 '네모트론' 인용 논문 145편...로봇 월드 모델·생명과학·합성 데이터로 확산, 네이버·머크·사카나AI 등 생태계도 성장

인공지능 3
마이크로소프트 엑스박스, 창사 이래 최대 구조조정...1년간 3,200명 감원하고 스튜디오 4곳 떼어낸다...아샤 샤르마 CEO "우리는 건강하지 않다" 공개서한, 게임 패스·멀티플랫폼 전략 성과 못 미쳐 모장·킹은 CEO 직속으로

마이크로소프트 엑스박스, 창사 이래 최대 구조조정...1년간 3,200명 감원하고 스튜디오 4곳 떼어낸다...아샤 샤르마 CEO "우리는 건강하지 않다" 공개서한, 게임 패스·멀티플랫폼 전략 성과 못 미쳐 모장·킹은 CEO 직속으로

정보기술 · 실감형콘텐츠 4
AI 경쟁의 승부처, 연산 성능에서 ‘메모리 계층 구조’로 이동…SK하이닉스, 풀스택 포트폴리오로 대응

AI 경쟁의 승부처, 연산 성능에서 ‘메모리 계층 구조’로 이동…SK하이닉스, 풀스택 포트폴리오로 대응

반도체 · 인공지능 3
오픈 웨이트 AI 'GLM 5.2', 오푸스·GPT 넘본다...한 분석가 "AI 추론 이익률 붕괴 임박"...성능은 최상위 모델급인데 가격은 15~20% 수준, 코딩 도구에 그대로 갈아 끼울 수 있어 전환 비용도 낮아

오픈 웨이트 AI 'GLM 5.2', 오푸스·GPT 넘본다...한 분석가 "AI 추론 이익률 붕괴 임박"...성능은 최상위 모델급인데 가격은 15~20% 수준, 코딩 도구에 그대로 갈아 끼울 수 있어 전환 비용도 낮아

인공지능 4