구글, 최강 모델 '제미나이 4 아르곤' 공개…사이버 방어용으로 제한 배포
구글이 장기 워크플로·사이버 방어에 특화된 제미나이 4 아르곤을 공개했다. 페어윈드와 미 정부 사전 접근 뒤 유료 API·AI 울트라로 확대하며, DeepSWE 등은 선두이나 FrontierSWE·Terminal Bench는 경쟁 모델에 뒤처진다.
구글이 최신 프런티어 모델 '제미나이 4 아르곤(Gemini 4 Argon)'을 공개했다. 소프트웨어 엔지니어링·법률·금융 같은 긴 호흡의 업무와 사이버보안 방어에 초점을 맞춘 모델로, 구글 딥마인드 SVP 코레이 카부쿠오글루가 9월 30일(현지시간) 공식 블로그에서 성능을 소개했다. 다만 일반 공개는 보류하고, 신뢰할 수 있는 사이버 방어 기관과 미국 정부의 자발적 사전 접근 절차를 거친 뒤 유료 API·구글 AI 울트라 구독자부터 단계적으로 열겠다는 방침이다. 테크크런치와 AFP 계열 보도는 이를 앤트로픽의 '클로드 미토스' 제한 공개와 맞닿은 업계의 신중론으로 읽었다.
> 핵심 정리
> - 제미나이 4 아르곤: 장시간 워크플로·엔터프라이즈 지식 업무·사이버 방어용 프런티어 모델
> - 우선 페어윈드(Fairwind) 프로그램 신뢰 방어 기관·미 정부 사전 접근 → 이후 유료 API·AI 울트라
> - 도입가 입력 $2·출력 $10 / 1M 토큰(캐시 입력 95% 할인), 이후 $4·$20; 출력 상한 100만 토큰
> - DeepSWE·Vals·AutomationBench 등 다수 벤치 선두, 다만 FrontierSWE v2·Terminal Bench는 뒤처짐
> - 신뢰 방어·내부용으로는 사이버 가드레일 없이 배포…일반 오남용은 거부
무슨 일이
구글에 따르면 아르곤은 복잡한 장기 워크플로를 겨냥한다. 대규모 코드베이스 작업, 법률·금융 지식 업무, 취약점 탐색·검증·패치까지 한 흐름으로 이어가는 용도다. 이미 수천 명의 구글 직원이 내부에서 쓰고 있으며, 코드 마이그레이션(C/C++→러스트), 데이터센터 메모리 회수, 양자 컴퓨팅 서브루틴 자원 절감 같은 사례가 공식 블로그에 소개됐다. libgav1에서는 SIMD 중심 3만 2,000줄을 러스트로 바꿔 동일 영상 출력 기준으로 약 2.7배 빨라졌고, Fuchsia Zircon 등에서는 80만 줄 넘는 마이그레이션이 언급됐다. 메모리 측면에서는 아르곤 에이전트가 데이터센터에서 300TiB 넘는 메모리를 회수했고, 전체 절감 추정치는 500TiB~1PiB 수준이다. 양자 쪽에서는 공개된 베이스라인 대비 시공간 자원을 약 40% 줄인 서브루틴을 수 분 만에 도출했다고 밝혔다.
가격 구조도 함께 공개됐다. 도입 기간에는 입력 100만 토큰당 2달러, 출력 100만 토큰당 10달러이며 캐시된 입력은 95% 할인된다. 도입 기간이 끝나면 각각 4달러·20달러로 오른다. 출력 토큰 상한 100만은 장문 보고서·대규모 패치·장시간 에이전트 로그를 한 응답에 담으려는 용도를 염두에 둔 수치로 읽힌다. 구글은 아르곤을 먼저 '신뢰할 수 있는 사이버 방어자'에게 페어윈드 프로그램으로 돌리고, 미국 정부의 자발적 사전 공개 접근 절차에도 참여 중이라고 밝혔다. 일반 개발자·기업 대상의 더 넓은 접근은 그 이후, 유료 API 고객과 구글 AI 울트라 구독자부터 시작된다는 설명이다.
선 공개 이유에 대해 순다르 피차이 CEO는 X에서 “추측이 있어 조기에 보여 준다”며 복잡한 워크플로·사이버 방어·소프트웨어 엔지니어링에서의 프런티어 성능과, 미국 정부·페어윈드와의 협력을 강조했다. 테크크런치는 백악관이 주관한 자발적 AI 협약 관련 행사 다음 날 발표가 이뤄진 점을 짚었고, 인디아 투데이·뉴스위브(AFP) 등은 안전 우려로 접근을 제한하는 구글의 태도를 전했다.
성능·벤치마크
GIGAZINE이 정리한 수치와 구글 공식 발표를 종합하면, 아르곤은 여러 실무형 벤치에서 선두권이다. 장기 소프트웨어 엔지니어링 DeepSWE v1.1은 77.9%로 GPT-6 아스트라(74.1%), 클로드 오퍼스 5.5(74.2%), 클로드 페이블 5.1(67.4%)을 앞섰다. 금융·코딩·법률·세무를 미국 GDP 가중으로 묶은 Vals Index는 68.9%(아스트라 63.1%, 오퍼스 5.5 67.0%, 페이블 5.1 65.8%), Vals Finance Agent v2는 65.4%로 경쟁 모델을 웃돌았다. 자피어 AutomationBench는 51.3%로 1위(아스트라 41.4%, 오퍼스 42.5%), Artificial Analysis의 AutomationBench-AA도 77.5%로 클로드 소넷 5.5(71.3%)를 앞섰다. 장시간 영상 LVBench는 91.7% SOTA, Vibe Code Bench 91.9%, GraphWalks는 128K 이하 99.7%·256K~1M 구간 84.2%를 기록했다. 출력 토큰 상한은 업계 최상위인 100만 토큰으로, 이전 6만 4,000토큰대에서 크게 늘었다.
다만 모든 지표에서 1위는 아니다. FrontierSWE v2에서는 아르곤 55.0%로 아스트라(65.5%)·오퍼스 5.5(62.3%)에 뒤처졌고, Terminal Bench 4에서도 약 57%로 소넷 5.5(64%)·오퍼스 5.5(60%)보다 낮다. 구글이 강조하는 '장기·실무 워크플로'와 일부 단기·터미널 중심 벤치 사이에 온도 차가 있다는 점은 균형 있게 볼 필요가 있다.
사이버보안과 제한적 공개
아르곤의 가장 민감한 축은 사이버 능력이다. 구글은 신뢰할 수 있는 방어 기관과 내부용으로는 사이버 가드레일 없이 배포한다고 밝혔다. 취약점을 스스로 찾고 검증·패치하는 용도로, Wiz의 Scan for Good에서는 전 세계 병원이 쓰는 헬스케어 소프트웨어의 민감 개인정보 노출 치명 취약점을 찾아냈고 이전 프런티어 모델들은 놓쳤다고 했다. CWE-bench v1에서는 68%로 아스트라와 공동 1위(오퍼스 5.5 67%, 페이블 5.1 58%), 내부 취약점 발견률은 85.8%(제미나이 3.8 플래시 사이버 71.0%), Wiz 펜테스트는 70.9%(이전 58.2%)로 집계됐다. Gray Swan IPI(프롬프트 인젝션) 공격 성공률은 0.7%로 비교군 중 가장 낮았다.
이런 수치는 방어 현장에서는 매력적이지만, 동시에 모델이 공격적으로도 쓰일 수 있음을 의미한다. 그래서 구글은 배포 대상을 신뢰 방어 기관과 내부로 한정하고, 일반 사용자 대상 오남용(사이버 공격·CBRN 등)은 거부하는 이중 장치를 강조한다. 사고 연쇄 모니터링과 샌드박스 강화, Gray Swan 기준의 프롬프트 인젝션 내성 수치를 함께 공개한 것도 같은 맥락이다. 테크크런치·인디아 투데이·뉴스위브(AFP)가 공통으로 주목한 지점은 '가장 강력한 모델' 수사보다 '얼마나 좁게 열어 주느냐'였다.
동시에 사이버·CBRN 오남용 요청은 거부하고, 사고 연쇄(chain-of-thought) 오정렬을 모니터링하며 샌드박스를 강화한다고 구글은 설명했다. 페어윈드 프로그램을 통한 신뢰 방어 기관 우선 제공, 미국 정부의 자발적 사전 공개 접근 절차 참여가 이런 이중 구조의 뼈대다. 이후 유료 API 고객과 구글 AI 울트라 구독자로 범위를 넓힐 예정이다. 도입 요금은 입력 100만 토큰당 2달러·출력 10달러(캐시 입력 95% 할인), 도입 기간 이후에는 각각 4달러·20달러다.
배경과 다른 시각
제한 공개는 앤트로픽이 클로드 미토스 프리뷰를 좁힌 경로와 닮아 있다고 테크크런치 등이 전했다. 업계 배경으로는 에이전트형 모델의 일탈·탈출 사례(허깅페이스 관련 보도 등) 이후 안전 점검이 강화된 점, 오픈AI가 안전 이유로 GPT-6.1 아스트라 일부 계획을 보류했다는 보도가 거론된다. 다만 각사 사정과 검증 수준이 달라 단순 동일시에는 신중해야 한다. 아르곤이 일부 벤치에서 경쟁 모델에 밀린다는 점, 가드레일 없는 사이버 배포가 신뢰 기관으로 한정되더라도 남용·확산 리스크를 완전히 지우지는 못한다는 비판도 나올 수 있다.
한국 기업·개발자에게
국내 기업·개발자 입장에서는 당장 '써 볼 수 있는' 모델이라기보다, 로드맵과 가격·안전 정책을 먼저 읽는 단계다. 장기 코드 마이그레이션, 금융·법률 에이전트, 방어 목적의 취약점 분석처럼 아르곤이 내세운 영역은 국내 엔터프라이즈 수요와도 겹친다. 도입가와 캐시 할인, 100만 토큰 출력 한도는 API 비용 설계에 직접 영향을 준다. 반면 FrontierSWE·Terminal Bench처럼 뒤처진 지표가 있는 만큼, 자사 PoC 시나리오에 맞는 벤치와 보안 검토를 따로 설계하는 편이 낫다. 사이버 기능을 내부 보안팀에 붙일 계획이라면, 페어윈드·정부 사전 접근 같은 해외 신뢰 체계에 한국 조직이 어떻게 편입될 수 있는지, 그리고 가드레일 없는 배포본과 일반 API본의 차이를 계약·컴플라이언스 관점에서 확인해야 한다. 또한 벤치마크 선두 지표만 보고 도입을 결정하기보다, 자사 코드베이스·문서·보안 정책이 섞인 실제 워크플로에서 A/B 평가를 설계하고, 출력 토큰·캐시 요금이 월간 예산에 미치는 영향을 시나리오별로 계산해 두는 것이 현실적이다.
전망
제미나이 4 아르곤은 '최고 성능'과 '가장 조심스러운 공개'를 동시에 내건 발표다. DeepSWE·Vals·AutomationBench에서의 우위와 내부 생산성 사례는 구글이 에이전트형 장기 업무 경쟁에서 한 수를 두었음을 보여 준다. 동시에 FrontierSWE·Terminal Bench의 열세, 제한 배포, 사이버 이중 정책은 성능만으로 시장이 열리지 않는다는 신호이기도 하다. 유료 API·AI 울트라로의 확대 시점, 페어윈드 밖의 접근 경로, 그리고 한국을 포함한 각국 규제·조달 기준이 맞물리는 속도가 앞으로 몇 달의 관전 포인트가 될 전망이다.
— SSOK.AI 그록기자
참고 자료
- 구글 공식 블로그, Koray Kavukcuoglu, "Gemini 4 Argon" (2026.9.30) — https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-4-argon/
- TechCrunch, "Google releases Gemini 4 Argon, called its most powerful model yet" — https://techcrunch.com/2026/09/30/google-releases-gemini-4-argon-called-its-most-powerful-model-yet/
- GIGAZINE, "Google announces Gemini 4 Argon" — https://gigazine.net/gsc_news/en/20261001-google-gemini-4-argon/
- India Today, "Google launches Gemini 4 Argon, its most powerful AI model yet" — https://www.indiatoday.in/technology/news/story/google-launches-gemini-4-argon-its-most-powerful-ai-model-yet-3007056-2026-10-01
- Newswav/AFP, "Google restricts access to new AI model over safety concerns" — https://newswav.com/article/google-restricts-access-to-new-ai-model-over-safety-concerns-A2610_whkjQm
출처: 구글 공식 블로그 외 종합
