한국정보기술진흥원2026 제7회 청소년 IT경시대회 개최안내

캑터스, 16.9MB 음성인식 모델 '위슬' 공개...인터넷 없이 기기 안에서 7개 언어 받아쓰기

캑터스가 스마트폰·웨어러블용 16.9MB 음성인식 모델 '위슬'을 공개했다.
[한국정보기술신문] 온디바이스 인공지능(AI) 기업 캑터스 컴퓨트(Cactus Compute)가 지난 2일(현지시간) 음성인식 모델 '위슬(Whistle)'을 공개했다. 위슬은 사람의 말을 글자로 바꿔주는 모델이다. 파일 하나의 크기는 16.9MB다. 스마트폰 사진 몇 장 정도의 용량이다. 별도의 그래픽 처리 장치(GPU) 없이 일반 중앙처리장치(CPU)에서 작동한다. 음성 데이터를 외부 서버로 보내지 않고 기기 안에서 바로 처리하는 것이 특징이다.
캑터스는 위슬의 사용처로 스마트폰, 웨어러블 기기, 로봇, 스마트홈, 자동차, 마이크로컨트롤러를 꼽았다. 마이크로컨트롤러는 가전제품 등에 들어가는 작은 제어용 칩이다.
image.png

30초 음성을 한 번에 받아쓰기

위슬이 하는 일은 크게 세 가지다. 첫째는 받아쓰기다. 최대 30초 길이의 음성을 한 번에 글자로 바꾼다. 지원 언어는 영어, 독일어, 프랑스어, 스페인어, 이탈리아어, 네덜란드어, 폴란드어 등 7개다. 사용자가 언어를 지정하지 않으면 모델이 스스로 언어를 알아낸다. 한국어는 지원 언어에 포함되지 않았다.
둘째는 단어별 시간 표시다. 각 단어가 몇 초에 시작해 몇 초에 끝났는지 알려준다. 그 단어를 맞게 들었을 확률도 함께 제공한다. 자막 제작이나 녹취록 검색 등에 쓸 수 있는 기능이다.
셋째는 음성 임베딩이다. 임베딩은 소리의 특징을 숫자 묶음으로 바꾼 것이다. 글자로 옮기지 않고도 음성끼리 비교하거나 분류할 때 활용된다.
이 밖에 특정 단어를 더 잘 알아듣게 하는 '키워드 지정' 기능이 있다. 사람 이름처럼 흔치 않은 단어를 미리 입력하면 인식 확률을 높여준다. 소리가 거의 없는 구간에서는 받아쓰기를 아예 시작하지 않는다. 조용한 녹음을 엉뚱한 글자로 바꾸는 오류를 막기 위해서다.

기존 '니들' 엔진과 부품 공유

위슬은 캑터스가 앞서 내놓은 소형 모델 '니들(Needle)'과 같은 엔진에서 돌아간다. 니들은 사용자의 말을 알아듣고 기기의 기능을 호출하는 모델이다. 예를 들어 "부엌 불 꺼줘"라는 문장을 조명 끄기 명령으로 바꿔준다.
캑터스에 따르면 위슬은 니들의 구성 요소를 그대로 가져다 썼다. 복사본이 아니라 니들의 코드를 직접 실행하는 방식이다. 음성을 처리하는 앞부분과 소리 정보를 읽어오는 장치만 새로 더했다. 여러 후보 문장을 동시에 검토해 가장 그럴듯한 것을 고르는 방식도 쓴다. 이를 '빔 서치'라고 한다. 위슬은 후보 5개를 함께 살핀다.

위스퍼보다 9분의 1 크기, 첫 글자 6배 빨라

캑터스는 오픈AI의 음성인식 모델 '위스퍼 베이스(Whisper base)', 소형 음성인식 모델 '문샤인 타이니 v2(Moonshine tiny v2)'와 위슬을 비교했다. 시험 환경은 애플 M4 프로 칩의 CPU였다. 10초 길이 음성을 기준으로 측정했다.
용량은 위슬이 16.9MB로 가장 작았다. 위스퍼 베이스는 145.3MB, 문샤인 타이니 v2는 41.9MB였다. 위슬이 위스퍼 베이스의 약 9분의 1 크기다.
음성을 넣은 뒤 첫 글자가 나오기까지 걸린 시간은 위슬이 11.1밀리초(ms)였다. 1밀리초는 1000분의 1초다. 위스퍼 베이스는 73.2밀리초, 문샤인 타이니 v2는 22.8밀리초였다. 위슬이 위스퍼 베이스보다 약 6.6배 빨랐다. 초당 만들어내는 글자 조각 수는 위슬이 1319개였다. 위스퍼 베이스(266개)의 약 5배 수준이다.
정확도는 '단어 오류율'로 비교했다. 단어 오류율은 받아쓴 결과에서 틀린 단어의 비율이다. 낮을수록 정확하다. 캑터스는 위슬이 영어 오디오북 낭독 자료(LibriSpeech), 기업 실적발표 녹음(Earnings-22) 등에서 더 낮은 오류율을 보였다고 밝혔다. 여러 언어를 섞은 시험(FLEURS) 평균에서도 앞섰다고 설명했다.

음성 명령을 곧바로 기능 실행으로

위슬은 니들과 함께 불러올 수 있다. 이 경우 프로그램 하나로 음성 파일을 곧장 기능 실행 명령으로 바꿀 수 있다. 엔진이 먼저 음성을 글자로 옮긴다. 이어 그 문장에 맞는 기기 기능을 골라 실행 정보를 돌려준다.
캑터스가 공개한 예시에서 "turn off the kitchen lights(부엌 불 꺼줘)"라는 음성은 조명 제어 명령으로 바뀌었다. 결과에는 받아쓴 문장과 감지된 언어도 함께 담겼다. 개발자가 중간에 받아쓴 글을 따로 처리할 필요가 없다는 것이 회사의 설명이다.
엔진은 17종의 기기 환경용으로 미리 만들어져 제공된다. 맥OS, 리눅스, 안드로이드, iOS, 워치OS, 윈도우(ARM), 웹 브라우저 등이 포함된다. 모델 가중치는 허깅페이스에, 소스 코드는 깃허브에 공개됐다. 파이썬에서는 설치 명령 한 줄로 사용할 수 있다.

모든 시험에서 앞선 것은 아니야

다만 위슬이 모든 항목에서 앞선 것은 아니다. 캑터스도 강연 녹음(TED-LIUM), 회의 녹음(AMI), 다국어 낭독 자료(MLS) 평균에서는 위스퍼 베이스의 오류율이 더 낮았다고 밝혔다.
비교 방식에도 살펴볼 점이 있다. 위슬의 오류율은 캑터스가 직접 8만6174개 문장으로 측정했다. 반면 위스퍼와 문샤인의 오류율은 각 개발사가 이전에 발표한 수치를 가져왔다. 같은 조건에서 함께 측정한 결과가 아닌 셈이다. 또 일부 시험은 비교 대상 모델의 수치가 아예 없었다. 문샤인은 영어만 지원하기 때문이다. 외부 기관의 독립적인 검증 결과는 아직 나오지 않았다.
캑터스는 시험용 음성이 학습 데이터에 섞이지 않았다고 강조했다. 음성 파일의 고유 식별값과 화자 정보를 대조해 확인했다는 설명이다. 지원 언어가 유럽 언어 7개에 그친다는 점도 한계로 꼽힌다.

소형 모델로 '기기 안의 AI' 노리는 캑터스

캑터스는 그동안 작은 기기에서 돌아가는 소형 모델에 집중해 왔다. 올해 공개한 니들은 기능 호출 하나에 특화된 모델이다. 대화형 AI처럼 모든 질문에 답하지는 못한다. 대신 용량이 작고 인터넷 없이 작동한다. 현재 최신판인 니들 3의 크기는 8~29MB다.
업계에서는 이런 소형 모델이 클라우드 비용과 개인정보 유출 우려를 줄일 수 있다고 본다. 음성은 특히 민감한 개인정보다. 서버로 보내지 않고 기기 안에서 처리하면 유출 위험이 줄어든다. 네트워크를 거치지 않아 반응 속도도 빨라진다. 위슬은 니들에 '귀' 역할을 더해 음성 비서 기능을 기기 안에서 완결하려는 시도로 풀이된다.
한국정보기술신문 인공지능분과 김현서 기자 news@kitpa.org

함께 읽으면 좋은 기사

농촌진흥청, 농생명 논문 학습한 '전문가 AI' 개발...답변마다 근거·출처 제시하고 내부 서버로 보안 강화

농촌진흥청, 농생명 논문 학습한 '전문가 AI' 개발...답변마다 근거·출처 제시하고 내부 서버로 보안 강화

인공지능 · 유관기관 3분
구글, AI 생성 콘텐츠 판별 도구 'SynthID 디텍터' 전 세계 공개...오픈AI·엔비디아·카카오 도구로 만든 콘텐츠도 확인 가능

구글, AI 생성 콘텐츠 판별 도구 'SynthID 디텍터' 전 세계 공개...오픈AI·엔비디아·카카오 도구로 만든 콘텐츠도 확인 가능

인공지능 2분
애플·영국 킹스 트러스트, 청년 창작자 교육 '크리에이티브 랩스' 출범...18~30세 청년 20명 1기, 런던 애플 뮤직 홀서 음악 워크숍 시작

애플·영국 킹스 트러스트, 청년 창작자 교육 '크리에이티브 랩스' 출범...18~30세 청년 20명 1기, 런던 애플 뮤직 홀서 음악 워크숍 시작

교육 · 정보기술 3분
캑터스, 16.9MB 음성인식 모델 '위슬' 공개...인터넷 없이 기기 안에서 7개 언어 받아쓰기

캑터스, 16.9MB 음성인식 모델 '위슬' 공개...인터넷 없이 기기 안에서 7개 언어 받아쓰기

인공지능 4분
애플, 맥에서 지갑 패스 만드는 '패스 디자이너' 베타 공개...코드 없이 실시간 미리보기·오류 검증 지원

애플, 맥에서 지갑 패스 만드는 '패스 디자이너' 베타 공개...코드 없이 실시간 미리보기·오류 검증 지원

정보기술 3분
오픈AI, 말로 웹사이트 만드는 'ChatGPT Sites' 공개 베타 운영...코딩 없이 사이트 제작부터 게시·공유까지

오픈AI, 말로 웹사이트 만드는 'ChatGPT Sites' 공개 베타 운영...코딩 없이 사이트 제작부터 게시·공유까지

인공지능 3분
AWS, 이란 공격 받은 바레인·UAE 데이터센터 일부 데이터 "복구 불가" 공식화...피격 6개월 만의 발표, 여러 가용 영역 동시 피해로 설계 한계 넘어서

AWS, 이란 공격 받은 바레인·UAE 데이터센터 일부 데이터 "복구 불가" 공식화...피격 6개월 만의 발표, 여러 가용 영역 동시 피해로 설계 한계 넘어서

클라우드 3분
애플, 아이폰 촬영 사진의 진위 증명하는 '레퍼런스 이미지' 공개...아이폰 18 프로 카메라 센서가 촬영 즉시 서명, 양자내성 암호 적용하고 촬영자 신원은 숨겨

애플, 아이폰 촬영 사진의 진위 증명하는 '레퍼런스 이미지' 공개...아이폰 18 프로 카메라 센서가 촬영 즉시 서명, 양자내성 암호 적용하고 촬영자 신원은 숨겨

정보보안 4분
과기정통부, 원주에 디지털헬스케어 특화 'AI융합혁신교육원' 개소...의료데이터·피지컬 AI 교육으로 올해 160명 양성, 기업-대학 연계 프로젝트로 채용까지 잇는다

과기정통부, 원주에 디지털헬스케어 특화 'AI융합혁신교육원' 개소...의료데이터·피지컬 AI 교육으로 올해 160명 양성, 기업-대학 연계 프로젝트로 채용까지 잇는다

인공지능 · 유관기관 2분
마이크로소프트, '.NET 11' 성능 개선 수백 건 공개...비동기 처리 구조 바꾸고 불필요한 검사·메모리 할당 줄여, 일부 코드는 5배 빨라져

마이크로소프트, '.NET 11' 성능 개선 수백 건 공개...비동기 처리 구조 바꾸고 불필요한 검사·메모리 할당 줄여, 일부 코드는 5배 빨라져

정보기술 4분
애플, iOS 27 등 새 운영체제 배포 시작...'시리 AI' 영어 베타 공개...한국어는 10월 지원, 자녀 보호 기능 강화하고 앱 실행 속도 최대 30% 개선

애플, iOS 27 등 새 운영체제 배포 시작...'시리 AI' 영어 베타 공개...한국어는 10월 지원, 자녀 보호 기능 강화하고 앱 실행 속도 최대 30% 개선

인공지능 4분
딥시크, KV 캐시 4분의 1로 줄인 'V4.1 플래시' 공개...층 간 캐시 공유·FP4 저장으로 장기 AI 에이전트 비용 절감 겨냥

딥시크, KV 캐시 4분의 1로 줄인 'V4.1 플래시' 공개...층 간 캐시 공유·FP4 저장으로 장기 AI 에이전트 비용 절감 겨냥

인공지능 4분