한국정보기술진흥원2026 제7회 청소년 IT경시대회 개최안내

구글 딥마인드, 로봇 지휘하는 '두뇌' AI '제미나이 로보틱스 ER 2' 공개...영상 보며 작업 진행 스스로 확인하고 여러 로봇 협업까지...사람 다가오면 멈추는 안전 기능도 강화

구글 딥마인드가 로봇용 '두뇌' 역할 AI 모델을 내놨다.
[한국정보기술신문] 구글(Google)의 인공지능(AI) 연구조직 구글 딥마인드(Google DeepMind)가 로봇을 사람처럼 판단하고 지휘하는 '두뇌' 역할의 새 AI 모델 '제미나이 로보틱스 ER 2(Gemini Robotics ER 2)'를 공개했다. 구글 딥마인드는 지난 7월 30일(현지시간) 자사 블로그를 통해 이 모델을 소개하고, 개발자들이 제미나이 API(응용프로그램 인터페이스)와 구글 AI 스튜디오(Google AI Studio) 등을 통해 곧바로 이용할 수 있다고 밝혔다. 회사는 이 모델을 로봇을 위한 '고차원 두뇌'라고 소개했다.
구글 딥마인드에 따르면 제미나이 로보틱스 ER 2는 로봇이 사람과 대화하고, 주변의 물리적 세계를 이해하며, 여러 단계로 이뤄진 복잡한 작업을 계획하도록 돕는다. 실제 팔·다리를 움직이는 세부 동작은 별도의 하위 모델인 '시각-언어-행동(VLA) 모델'에 넘긴다. 시각-언어-행동 모델이란 눈으로 본 것과 말로 받은 지시를 실제 로봇의 움직임으로 바꿔 주는 AI를 말한다. 이 모델은 회사가 '체화된 추론(embodied reasoning)'이라고 부르는 능력을 갖췄는데, 이는 AI가 컴퓨터 속 정보만 다루는 데 그치지 않고 몸을 가진 로봇처럼 실제 공간과 사물을 헤아려 판단하는 것을 뜻한다. 아울러 이 모델은 구글 검색 같은 도구나 이용자가 직접 정한 기능을 스스로 불러 쓸 수 있으며, 행동을 하는 동시에 다음에 무엇을 할지 '생각'할 수 있다고 회사는 설명했다.
image.png
구글 제공

영상 보며 스스로 진행 상황 확인

제미나이 로보틱스 ER 2는 앞서 나온 '제미나이 로보틱스 ER 1.6'을 크게 개선한 모델이다. 구글 딥마인드는 이번 모델이 끊김 없이 이어지는 영상을 지켜보면서 로봇이 자기 작업이 얼마나 진행됐는지 스스로 추적하고, 문제가 생기면 대응 방식을 바꾸며, 다음 단계로 넘어갈 시점을 정확히 알 수 있게 됐다고 밝혔다. 예를 들어 전구를 끼우거나 쓰레기봉투를 묶는 것처럼 여러 손놀림이 필요한 작업이 정해진 대로 제대로 끝났는지를 확인한 뒤에야 다음 작업으로 넘어가도록 한다는 것이다.

여러 단계 작업 지휘하는 '물리적 에이전트'

현실에서 이뤄지는 대부분의 작업은 여러 단계를 거쳐야 완성된다. 구글 딥마인드는 제미나이 로보틱스 ER 2를 이런 여러 단계를 순서대로 지휘하는 '물리적 에이전트(physical agent)'로 규정했다. 에이전트란 사람이 일일이 지시하지 않아도 목표를 이루기 위해 스스로 판단해 여러 작업을 처리하는 AI를 말한다. 이 모델은 작업 도중 잘못된 부분을 스스로 바로잡고, 처음 겪는 낯선 상황에도 대응할 수 있다.
개발자는 로봇을 움직이는 하위 제어 장치나 길 찾기 기능 등을 하나의 '도구'로 등록해 두고, 영상과 소리, 글을 이 모델에 곧바로 흘려보내는 방식으로 로봇을 꾸릴 수 있다. 구글 딥마인드는 이번 모델이 이렇게 여러 도구를 부려 쓰는 능력에서, 실제 로봇과 컴퓨터 속 가상 로봇, 사람이 원격으로 조종하는 로봇 등 세 가지 방식 모두에서 이전 모델을 앞섰다고 밝혔다.
또 이 모델은 반응 속도가 중요한 작업을 위해 지연 시간을 줄인 '제미나이 라이브 API'와 결합돼, 로봇이 '멈춰 서서 생각하는' 어색한 끊김 없이 매끄럽게 여러 단계 작업을 수행한다고 회사는 설명했다. 구글 딥마인드는 이를 보여 주기 위해 로봇 전문 기업 보스턴 다이내믹스(Boston Dynamics)의 사족보행 로봇 '스폿(Spot)'과 함께 시연을 선보였다. 이 로봇은 사람이 말로 지시하면 팝콘 같은 간식을 집어다 가져다준다.

'언제 끝났는지' 아는 능력...진행률 추적·순간 포착

구글 딥마인드는 로봇 기술에서 가장 어려운 문제 가운데 하나로 '작업이 언제 끝났는지 아는 것'을 꼽았다. 이번 모델은 이를 위해 두 가지 능력을 끌어올렸다. 하나는 '진행률 분류'로, 영상 속 각 장면을 020%, 2040% 식으로 다섯 단계로 나눠 작업이 얼마나 진척됐는지 실시간으로 가늠하는 능력이다. 이를 통해 로봇은 상황을 즉각 파악해 동작을 바로바로 고치거나, 실패한 단계를 전체 작업을 처음부터 되돌리지 않고 다시 시도할 수 있다. 구글 딥마인드는 이 항목에서 57.4%의 정확도를 기록해 이전 세대 모델과 경쟁사의 최신 모델을 앞섰다고 밝혔다.
다른 하나는 '순간 포착'으로, 어떤 결정적 장면이 일어나는 정확한 지점을 찾아내는 능력이다. 예컨대 컵에 커피를 따르다 언제 멈춰야 하는지를 짚어 내는 식이다. 구글 딥마인드는 이 항목에서 91.3%의 정확도를 기록했으며, 훨씬 큰 규모의 모델과 견줄 만한 성능을 훨씬 적은 계산 비용과 네 배 빠른 속도로 달성했다고 설명했다. 회사는 이런 1초 안팎의 빠른 반응이 실제 환경에서 로봇을 안전하게 다루는 데 꼭 필요하다고 덧붙였다.

서로 다른 로봇이 힘 합친다

이번 모델의 또 다른 특징은 여러 대의 로봇이 힘을 합치도록 하는 '다중 로봇 협업' 기능이다. 구글 딥마인드는 모든 작업에 두루 맞는 단일 로봇은 없다고 설명했다. 바퀴 달린 로봇은 실내에서 유리하고, 사람 모습을 한 휴머노이드 로봇은 울퉁불퉁한 땅에서 강점을 보이는 식이다. 휴머노이드란 머리·팔·다리 등 사람과 비슷한 형태를 갖춘 로봇을 말한다. 이 모델은 생김새와 기능이 다른 여러 로봇이 뜻을 공유하며 작업을 주고받아, 한 대로는 해내기 어려운 복잡한 일을 함께 완수하도록 돕는다. 구글 딥마인드는 로봇 기업 앱트로닉(Apptronik)의 휴머노이드 로봇 '아폴로 2'와 또 다른 로봇 팔이 서로 협력하는 사례를 함께 선보였다.

공간 이해·안전 기능도 강화

제미나이 로보틱스 ER 2는 공간을 파악하는 기본 능력도 끌어올렸다. 정지된 사진이 아니라 이어지는 영상을 보고 작업 도중의 실패, 이를테면 액체를 쏟거나 물건이 미끄러지거나 어긋나는 상황을 잡아낸다. 또 둥근 계기판뿐 아니라 디지털 화면, 자, 액체 온도계 등 열 가지 종류의 계측기 눈금을 읽을 수 있게 됐다. 이 밖에 화면 속 상황을 보고 사람의 질문에 답하는 능력도 개선됐다고 회사는 밝혔다.
안전 기능도 강화됐다. 구글 딥마인드는 이번 모델이 자사가 내놓은 로봇 AI 가운데 가장 안전하다며, 사람이 가까이 다가오면 휴머노이드 로봇을 멈춰 세우고 주변이 안전해진 뒤에야 스스로 작업을 다시 시작한다고 밝혔다. 회사는 로봇이 안전 규칙을 얼마나 잘 지키는지, 곁에 있는 사람을 얼마나 잘 알아채는지를 평가하는 시험에서도 이전 모델과 경쟁 모델을 앞섰다고 설명했다. 아울러 로봇을 지휘하는 AI가 안전 규칙을 지키고 주변을 살피며, 물리적으로 무리한 작업인지 판단하고 필요하면 사람에게 되묻는 능력을 평가하는 새 기준도 함께 내놓았다고 밝혔다.
한국정보기술신문 인공지능분과 박연호 기자 news@kitpa.org

함께 읽으면 좋은 기사

2026 하계 대학생 IT논문경진대회 결과 발표...고려대 이동근 팀·대구한의대 조소혜 팀 대상, 우수 논문 16개 팀에 대상 2·금상 6·은상 8 수여

2026 하계 대학생 IT논문경진대회 결과 발표...고려대 이동근 팀·대구한의대 조소혜 팀 대상, 우수 논문 16개 팀에 대상 2·금상 6·은상 8 수여

교육 · 인공지능 · 디지털인문학 5
2026 하계 청소년 IT학술대회 본선 23개 팀 수상...충남과학고 성지원·고색고 최우석 대상, 초등 6학년부터 고3까지 참여

2026 하계 청소년 IT학술대회 본선 23개 팀 수상...충남과학고 성지원·고색고 최우석 대상, 초등 6학년부터 고3까지 참여

교육 · 인공지능 · 디지털인문학 5
SK하이닉스, FMS 2026서 '계층형 메모리' 기반 차세대 AI 인프라 해법 제시...샌디스크와 HBF 첫 표준 규격 공개, 375단 4D 낸드 웨이퍼도 첫선

SK하이닉스, FMS 2026서 '계층형 메모리' 기반 차세대 AI 인프라 해법 제시...샌디스크와 HBF 첫 표준 규격 공개, 375단 4D 낸드 웨이퍼도 첫선

반도체 4
SK하이닉스, 용인·청주 신규 팹에 54조원 투자 결정...7일 이사회 의결, 용인 Y2에 35조2000억원·청주 M17에 19조1000억원, D램과 낸드 생산 거점 동시 확충

SK하이닉스, 용인·청주 신규 팹에 54조원 투자 결정...7일 이사회 의결, 용인 Y2에 35조2000억원·청주 M17에 19조1000억원, D램과 낸드 생산 거점 동시 확충

반도체 4
네팔 정부, 유출 계정 조회 서비스 HIBP에 47번째로 합류...국가사이버보안센터, 정부 도메인 이메일 유출 상시 감시 나서

네팔 정부, 유출 계정 조회 서비스 HIBP에 47번째로 합류...국가사이버보안센터, 정부 도메인 이메일 유출 상시 감시 나서

정보보안 3
깃허브 액션 8시간 44분 장애 끝에 복구...웹훅 85% 차단하며 밀린 작업 처리했다...한국시간 7일 오전 0시 22분 시작, 오전 9시 6분 완화 선언, 러너에 만료된 작업이 배정되는 오류가 원인, 페이지스·코파일럿 서비스도 함께 영향

깃허브 액션 8시간 44분 장애 끝에 복구...웹훅 85% 차단하며 밀린 작업 처리했다...한국시간 7일 오전 0시 22분 시작, 오전 9시 6분 완화 선언, 러너에 만료된 작업이 배정되는 오류가 원인, 페이지스·코파일럿 서비스도 함께 영향

정보기술 4
미 NSF, 1억 달러 규모 'AI 인프라 허브' 사업 착수...엔비디아·AMD·인텔 등 민간 참여...최대 10개 지역 컨소시엄 선정, 대학 간 AI 연구 격차 해소 겨냥

미 NSF, 1억 달러 규모 'AI 인프라 허브' 사업 착수...엔비디아·AMD·인텔 등 민간 참여...최대 10개 지역 컨소시엄 선정, 대학 간 AI 연구 격차 해소 겨냥

인공지능 4
미 뉴멕시코 법원, 메타에 5억6700만 달러 추가 부담 명령...아동 정신건강 기금 조성하고 미성년자 이용 시간도 월 90시간으로 제한

미 뉴멕시코 법원, 메타에 5억6700만 달러 추가 부담 명령...아동 정신건강 기금 조성하고 미성년자 이용 시간도 월 90시간으로 제한

방송통신 5
삼성전자, 런던서 '갤럭시 커뮤니티 커넥트' 개최...17개국 고객 51명 언팩 현장 참관

삼성전자, 런던서 '갤럭시 커뮤니티 커넥트' 개최...17개국 고객 51명 언팩 현장 참관

정보기술 3
농촌진흥청, 세계식육과학기술대회 16년 만에 한국 개최...50개국 전문가 1,000여 명, 9~14일 대전서 AI 스마트공장·지속가능성 논의

농촌진흥청, 세계식육과학기술대회 16년 만에 한국 개최...50개국 전문가 1,000여 명, 9~14일 대전서 AI 스마트공장·지속가능성 논의

유관기관 3
AMD, AI 모델을 반도체에 새기는 스타트업 '탈라스' 인수...메모리 없이 가중치를 실리콘에 직접 각인, 초당 1만7000토큰 시제품으로 엔비디아 추론 시장 정조준

AMD, AI 모델을 반도체에 새기는 스타트업 '탈라스' 인수...메모리 없이 가중치를 실리콘에 직접 각인, 초당 1만7000토큰 시제품으로 엔비디아 추론 시장 정조준

반도체 · 인공지능 4
엔비디아, 개방형 '월드 모델'로 물리 AI 생태계 확장...로봇·자율주행·비전 AI 겨냥한 코스모스 3, 640억~40억 매개변수 3종으로 공개...삼성전자·LG전자·두산로보틱스 등 활용

엔비디아, 개방형 '월드 모델'로 물리 AI 생태계 확장...로봇·자율주행·비전 AI 겨냥한 코스모스 3, 640억~40억 매개변수 3종으로 공개...삼성전자·LG전자·두산로보틱스 등 활용

인공지능 · 반도체 · 정보통신 4