Skip to content

Latest commit

 

History

History
135 lines (82 loc) · 19.7 KB

File metadata and controls

135 lines (82 loc) · 19.7 KB

English | Español | Português | 日本語 | 한국어 | Deutsch | Français | Türkçe | 繁體中文 | 简体中文 | Русский | العربية


Google Gemma 4: 유출부터 폭발적 인기까지, 전방위 심층 분석

Google Gemma 4는 2026년 4월 2일 공식 출시되었으며, Gemma 시리즈 역사상 가장 큰 세대 도약입니다. 이번 세대는 최초로 Apache 2.0 오픈소스 라이선스를 채택했고(이전 Gemma 시리즈는 모두 제한적 라이선스를 사용), 4가지 모델 크기(E2B, E4B, 26B MoE, 31B Dense)를 제공하며, 텍스트, 이미지, 비디오, 오디오 네 가지 모달리티를 네이티브로 지원하고, 컨텍스트 윈도우를 최대 256K tokens까지 확장했습니다. AIME 2026 수학 벤치마크에서 31B 모델은 Gemma 3의 20.8%에서 **89.2%**로 급등했고, 코딩 능력(LiveCodeBench)은 29.1%에서 80.0%로 도약하여, Gemma가 "사용 가능한 수준"에서 "최정상급 대형 모델과 경쟁 가능한" 새로운 단계로 진입했음을 보여줍니다. 출시 48시간 만에 Ollama 풀 횟수가 20.7만 회를 넘었고, 4월 10일 기준 누적 다운로드 수는 4억 회를 돌파했습니다.


Gemma 시리즈의 전체 진화 타임라인

Gemma 4의 의미를 이해하려면 먼저 전체 시리즈의 발전 흐름을 살펴볼 필요가 있습니다. Google은 2024년 초부터 약 반년에서 1년 주기로 Gemma 시리즈를 반복 개선해 왔으며, 매 세대마다 아키텍처, 모달리티, 개방성 측면에서 눈에 띄는 업그레이드를 진행했습니다.

**Gemma 1(2024년 2월 21일)**은 Google 최초의 개발자 대상 오픈 웨이트 모델 시리즈로, 2B와 7B 두 가지 파라미터 규모를 제공하며 Gemini와 동일한 기술 기반을 채택했습니다. 두 달 후인 4월 9일, 코드 생성에 특화된 CodeGemma(2B/7B)가 출시되었습니다.

**Gemma 2(2024년 6월 27일)**는 Google I/O 2024(5월 14일)에서 예고된 후 공식 출시되었으며, 파라미터 규모를 9B와 27B로 확장하고 Grouped-Query Attention(GQA)과 80K 토큰 컨텍스트 윈도우를 도입했습니다. 7월 31일에는 2B 변형과 안전 평가 모델 ShieldGemma가 추가되었습니다. 같은 해 말에는 비전-언어 모델 PaliGemma와 업그레이드 버전 PaliGemma 2가 연이어 출시되었습니다.

**Gemma 3(2025년 3월 12일)**는 여러 가지 핵심 돌파구를 달성했습니다: 최초로 멀티모달 기능 도입(텍스트+이미지 입력), 컨텍스트 윈도우를 8K에서 128K tokens로 대폭 확장, 140개 이상의 언어 지원, 1B, 4B, 12B, 27B 네 가지 크기 제공. LMArena에서 1338 Elo를 달성하여 훨씬 큰 모델들을 능가하는 성능을 보여주었습니다. 같은 해 5월 22일 Google I/O 2025에서는 엣지 디바이스 최적화를 위한 Gemma 3n(E2B/E4B)이 발표되었으며, 이후 Gemma 4에서 중요한 역할을 하게 되는 Per-Layer Embeddings(PLE) 기술 혁신이 도입되었습니다.

세대 출시일 이전 세대와의 간격 핵심 돌파구
Gemma 1 2024-02-21 -- 최초의 오픈 웨이트 모델
Gemma 2 2024-06-27 ~4개월 27B 파라미터, GQA
Gemma 3 2025-03-12 ~8.5개월 멀티모달, 128K 컨텍스트
Gemma 3n 2025-05-22 ~2개월(하위 버전) 엣지 디바이스 최적화, PLE
Gemma 4 2026-04-02 ~12.5개월 Apache 2.0, MoE, 256K, 오디오

"significant-otter" 유출과 출시 전야의 신호들

Gemma 4의 공식 출시 약 일주일 전, 일련의 유출과 암시가 커뮤니티에 파문을 일으켰습니다.

2026년 3월 28-29일, LMSYS Chatbot Arena에 **"significant-otter"**라는 코드명의 익명 모델이 등장했습니다. 사용자가 정체를 추궁하자 이 모델은 직접적으로 답했습니다: "I am Gemma 4, a large language model developed by Google DeepMind." Reddit r/LocalLLaMA 커뮤니티 사용자들이 이 유출을 가장 먼저 발견했으며, 해당 모델의 빠른 응답 속도, 기본 능력 테스트 통과, 그리고 추론 전용 모델이 아니라는 점을 확인했습니다. 유출 정보에는 2B, 4B Dense 변형과 120B/15B-active MoE 모델의 존재도 암시되어 있었습니다(이 대형 모델은 현재까지 공식 출시되지 않았습니다). 이 사건은 barnacle.ai, KuCoin 뉴스, 다수의 AI 뉴스레터, Reddit 토론에서 광범위하게 보도되었습니다.

3월 말~4월 초, Hugging Face에서 Google의 "Gemma models family" 컬렉션이 업데이트되었습니다. 이는 Gemma 2 및 Gemma 3 출시 전의 패턴과 정확히 일치하여, 커뮤니티 모델 관찰자들이 임박한 출시 신호로 표시했습니다.

4월 2일 새벽(출시 수 시간 전), Google DeepMind CEO Demis Hassabis가 X에 **다이아몬드 이모지 네 개(diamond diamond diamond diamond)**를 게시했고, 이어서 Google AI Studio 및 Gemini API 책임자 Logan Kilpatrick이 단 한 단어 게시물을 올렸습니다: "Gemma." 이 두 게시물은 커뮤니티에서 출시 카운트다운 신호로 널리 해석되어, 활발한 출시 전 논의를 촉발했습니다.


네 가지 모델의 아키텍처 설계와 기술 사양

Gemma 4는 Transformer 기반 모델 패밀리로, Gemini 3의 연구 성과에서 파생되었으며, 하이브리드 어텐션 메커니즘(로컬 슬라이딩 윈도우 어텐션과 글로벌 풀 컨텍스트 어텐션의 교차 사용)을 채택하고 여러 최첨단 아키텍처 혁신을 도입했습니다.

모델 사양 개요:

모델 아키텍처 총 파라미터 유효/활성 파라미터 레이어 수 컨텍스트 윈도우 모달리티
E2B Dense + PLE 5.1B 2.3B 35 128K 텍스트, 이미지, 비디오, 오디오
E4B Dense + PLE 8B 4.5B 42 128K 텍스트, 이미지, 비디오, 오디오
26B A4B MoE 25.2B 3.8B 30 256K 텍스트, 이미지, 비디오
31B Dense 30.7B 30.7B 60 256K 텍스트, 이미지, 비디오

이 중 26B A4B는 Gemma 시리즈 최초의 MoE(Mixture of Experts) 모델로, 각 레이어에 128개의 전문가를 포함하며 토큰당 8개의 전문가와 1개의 공유 전문가가 활성화되어 실제 추론 시에는 약 3.8B 파라미터만 활성화됩니다. 실행 속도는 4B Dense 모델에 근접합니다.

핵심 아키텍처 혁신 사항: Per-Layer Embeddings(PLE)는 모든 정보를 단일 임베딩에 전방 배치하는 대신 각 디코더 레이어에 독립적인 토큰 수준 조건 신호를 제공합니다. Shared KV Cache는 후속 N개 레이어가 이전 레이어의 Key-Value 상태를 재사용하여 메모리를 절약합니다. 듀얼 RoPE 구성은 슬라이딩 윈도우 레이어에서 표준 RoPE를, 글로벌 레이어에서 비례 RoPE(p-RoPE)를 사용하여 더 긴 컨텍스트를 지원합니다. Unified Keys and Values는 장문 컨텍스트 메모리를 최적화합니다. 비전 인코더는 가변 종횡비와 구성 가능한 토큰 예산(이미지당 70~1120 tokens)을 지원하며, 오디오 인코더(E2B/E4B만 해당)는 USM 스타일의 Conformer 아키텍처 기반으로 최대 30초 오디오 입력을 지원합니다. 어휘 크기는 262K tokens이며, 140개 이상의 언어를 지원하고(기본 35개 이상), 활성화 함수는 GeGLU, 정규화는 RMSNorm을 사용합니다.

특수 기능 측면에서 Gemma 4는 구성 가능한 사고 모드(<|think|> 토큰을 통해 4000개 이상의 토큰으로 구성된 내부 추론 체인 생성 가능), 네이티브 함수 호출 및 도구 사용, 구조화된 JSON 출력, 네이티브 시스템 프롬프트(Gemma 시리즈 최초로 system 역할 지원), 멀티스텝 계획 수립을 위한 Agent 워크플로, 객체 감지 및 위치 파악(JSON 형식의 바운딩 박스 좌표 네이티브 반환), 문서/PDF 파싱, 다국어 OCR, 차트 이해, 필기 인식 등을 지원합니다.


벤치마크 성능: 세대 수준의 성능 도약

Gemma 4는 주요 벤치마크 전반에서 놀라운 성과를 보여주었으며, 특히 Gemma 3 27B와의 비교에서 거의 모든 지표가 2배 이상의 향상을 달성했습니다. 아래는 공식 모델 카드에 공개된 수치입니다(Instruction-tuned 버전, 사고 모드 활성화 기준):

벤치마크 31B 26B A4B E4B E2B Gemma 3 27B
MMLU Pro 85.2% 82.6% 69.4% 60.0% 67.6%
AIME 2026 89.2% 88.3% 42.5% 37.5% 20.8%
GPQA Diamond 84.3% 82.3% 58.6% 43.4% 42.4%
LiveCodeBench v6 80.0% 77.1% 52.0% 44.0% 29.1%
Codeforces ELO 2150 1718 940 633 110
MMMU Pro(비전) 76.9% 73.8% 52.6% 44.2% 49.7%
MATH-Vision 85.6% 82.4% 59.5% 52.4% 46.0%
tau2-bench(Agent) 76.9% 68.2% 42.2% 24.5% 16.2%
Arena AI 텍스트 Elo 1452(#3) 1441(#6) -- -- 1365

특히 두드러진 향상 항목: 수학 능력(AIME)이 20.8%에서 89.2%로, 68.4 퍼센트포인트 향상; 코딩 능력(LiveCodeBench) 50.9 퍼센트포인트 향상; Agent 능력(tau2-bench) 60 퍼센트포인트 이상 향상; Codeforces ELO가 110에서 2150으로 약 20배 성장. 31B 모델은 Arena AI 텍스트 랭킹에서 오픈 모델 3위(미국 오픈 모델 1위)를 기록했습니다.

주목할 점은, 공식 모델 카드가 주요 평가 지표로 기존 MMLU가 아닌 MMLU Pro를, HumanEval이 아닌 LiveCodeBench/Codeforces ELO를 사용했다는 것입니다. 기존 MMLU와 HumanEval 점수는 공식 자료에 보고되지 않았습니다. 한편 서드파티 비교 논문(arXiv 2604.07035, 2026년 4월 8일)에서는 Gemma 4, Phi-4, Qwen3를 대상으로 Dense vs MoE 추론 언어 모델의 정확도-효율성 트레이드오프를 분석했습니다. 현재까지 Google은 Gemma 4에 대한 공식 기술 보고서를 발표하지 않았습니다.


전 플랫폼 출시 타임라인: 전례 없는 첫날 생태계 커버리지

Gemma 4의 출시 전략은 오픈소스 모델 역사상 유례를 찾기 어려운 수준입니다. 거의 모든 주요 AI 도구와 플랫폼이 4월 2일 같은 날 지원을 시작했으며, 이는 Google이 출시 전 생태계 파트너들과 긴밀한 사전 조율을 진행했음을 보여줍니다.

4월 2일 첫날 출시된 플랫폼 및 도구:

  • Hugging Face: google/gemma-4-* 네임스페이스에 모든 변형 업로드; 4월 10일 기준 31B 모델 다운로드 133만+, 26B 105만+, 커뮤니티에서 1,156개 이상의 gemma4 태그 모델 생성
  • Google AI Studio / Gemini API: 31B 및 26B MoE 당일 실험 및 API 호출 가능
  • Vertex AI: 자체 배포 엔드포인트 및 파인튜닝 지원, Cloud Run에서 NVIDIA RTX PRO 6000 GPU로 배포 가능
  • Kaggle: 모델 웨이트 당일 다운로드 가능, "Gemma 4 Good Challenge" 동시 개최
  • Ollama: gemma4 이름으로 17개 모델 태그 제공, 4월 10일 기준 풀 횟수 180만+
  • LM Studio: 전용 모델 페이지 lmstudio.ai/models/gemma-4에서 네 가지 변형 모두 이용 가능
  • NVIDIA NIM/NeMo: 무료 프로토타이핑 + NeMo Automodel 파인튜닝 지원 + NVFP4 양자화 체크포인트
  • llama.cpp, vLLM, MLX, SGLang, Unsloth, Baseten, Keras, Docker: 모두 첫날 지원

4월 2-3일 후속 출시된 서드파티 API 서비스: OpenRouter(31B 가격 $0.14/M 입력, $0.40/M 출력 tokens), Together AI, Fireworks AI, Replicate, 그리고 Hugging Face 추론 프로바이더를 통한 Featherless AI, Scaleway, OVHcloud 등.

4월 10일 기준 아직 Gemma 4를 지원하지 않는 주요 플랫폼: Groq(4월 3일 커뮤니티에서 기능 요청이 제출되었으나 미구현), AWS Bedrock(Gemma 3만 목록에 있으며 Gemma 4는 SageMaker를 통한 자체 호스팅 배포 필요), Azure AI Foundry(마찬가지로 Gemma 3만 지원, 수동 배포 필요).


커뮤니티 반응 폭발과 멀티플랫폼 논의 양상

Gemma 4의 소셜 미디어 반응은 **"유출 예열 -> 출시 폭발 -> 심층 리뷰"**라는 명확한 3단계 곡선을 보여주었습니다.

1단계: 예열 기간(3월 28일~4월 1일). "significant-otter"의 LMSYS Arena 유출이 먼저 r/LocalLLaMA에서 논의를 촉발했고, X/Twitter와 AI 뉴스레터로 확산되었습니다. Demis Hassabis의 다이아몬드 이모지 네 개와 Logan Kilpatrick의 한 단어 게시물이 기대감을 더욱 고조시켰습니다.

2단계: 폭발 기간(4월 2-4일). 출시 당일 Hacker News 메인 게시물 *"Google releases Gemma 4 open models"*는 1,306+ 추천을 받으며 여러 차례 프론트페이지에 올랐습니다. AINews가 추적한 12개 서브섹션과 544개 Twitter 계정의 활동 점수는 3,412점에 달했습니다. 48시간 내 Ollama 풀 횟수가 20.7만 회를 넘었습니다. llama.cpp 창시자 **Georgi Gerganov(@ggerganov)**가 공개한 Gemma 4 26B A4B Q8_0의 M2 Ultra에서 실시간 비디오 처리 300 t/s 데모는 가장 바이럴한 기술 시연이 되었습니다.

3단계: 심층 리뷰 기간(4월 4-10일). 커뮤니티가 실제 배포와 비교 테스트 단계로 전환했습니다. r/LocalLLaMA에는 "Gemma 4 for 16 GB VRAM" 양자화 파라미터 추천, TurboQuant KV 캐시 양자화 실험, Apple Silicon에서의 멀티모달 파인튜닝 도구(HN에서 152 추천) 등 다수의 실전 게시물이 쏟아졌습니다. M3 Pro에서 Gemma E2B를 활용한 실시간 오디오/비디오 AI 데모는 Reddit과 HN에서 동시에 주목을 받았습니다.

중국어 커뮤니티의 반응: Zhihu(知乎)에서 여러 고열 게시물이 Gemma 4를 심층 분석했습니다. 新智元은 *"31B가 20배 거대 모델을 격파"*라는 제목으로 보도했습니다. "대형 모델 주제 우수 답변자"의 테스트 결론에 따르면, 31B의 품질은 DeepSeek V3.2에 상당하며 Qwen3.5-27B의 65% 토큰만으로 동등한 출력 품질에 도달할 수 있지만, 추론 안정성은 Qwen3.5에 비해 현저히 낮았습니다(전체 테스트 문제 중 3회 출력에서 일관성을 유지한 것이 1개에 불과한 반면 Qwen3.5는 8개). 또한 Gemma 4가 출시 90분 만에 Heretic v1.2.0에 의해 탈옥(KL divergence 0.1522로 능력 손실 거의 없음)된 사건은 Zhihu에서 AI 안전의 근본적 한계에 대한 광범위한 논의를 촉발했습니다.


호평과 비판: 커뮤니티 평가의 양면

커뮤니티가 높이 평가한 다섯 가지: Apache 2.0 라이선스는 "가장 중요한 단일 변화"로 널리 인식되며, Gemma 1-3를 괴롭혔던 기업 법적 마찰을 해소했습니다. 파라미터 효율성은 인상적이었습니다 -- 31B가 200B+ 모델과 경쟁하고, 26B MoE는 활성 파라미터 3.8B만으로 31B에 근접하는 품질을 보여 "사용 가능한 최고의 지능/파라미터 비율"이라 불렸습니다. 엣지 배포 능력 덕분에 E2B가 2GB 메모리에서 실행 가능해져 "VRAM이 부족한 사용자도 처음으로 로컬에서 일상적으로 사용 가능한 모델을 실행할 수 있게" 되었습니다. 첫날 생태계 커버리지의 범위는 전례가 없었습니다. Gemma 3 대비 성능 향상에 대해 커뮤니티는 "이것은 점진적 개선이 아니라 완전히 다른 모델"이라고 평가했습니다.

주요 비판 사항: MoE 추론 속도가 기대보다 느렸습니다 -- 26B A4B는 RTX 5060 Ti에서 약 11 t/s에 불과한 반면 Qwen 3.5 35B-A3B는 60+ t/s를 달성했고, MoE 라우팅 오버헤드가 두드러졌습니다. 출시 초기 파인튜닝 도구 체인에 문제가 있었습니다 -- PEFT가 Gemma4ClippableLinear 레이어를 처리하지 못하고, 순수 텍스트 데이터에 mm_token_type_ids가 필요한 등의 이슈가 있었습니다. 소문으로 돌던 더 큰 120B MoE 모델이 출시되지 않은 것에 대한 실망도 있었습니다. 오디오 모달리티가 소형 모델(E2B/E4B)에만 제한되고 26B/31B에는 포함되지 않은 점도 아쉬운 부분으로 지적되었습니다. 추론 안정성과 환각 문제도 제기되었는데, 한 식물학 벤치마크에서는 검색 증강을 활성화해도 2.5/5점에 그쳤습니다. Redis 창시자 antirez의 HN 비판은 광범위한 논의를 불러일으켰습니다: "ELO 점수를 주요 벤치마크 지표로 제시하는 것은 매우 오해의 소지가 있다. 대형 Dense Gemma 4 모델은 대부분의 벤치마크에서 Qwen 3.5 27B Dense를 넘어서지 못하는 것으로 보인다."

주요 경쟁 모델과의 비교 합의: Qwen 3.5와의 비교가 가장 많이 논의된 주제였습니다. 벤치마크상으로 양쪽은 근접하며, Qwen 3.5가 MMLU Pro(86.1% vs 85.2%)와 GPQA Diamond에서 근소하게 앞서고, Gemma 4가 AIME와 Codeforces에서 앞섰지만, Qwen이 추론 속도가 더 빠르고 Agent 작업에서 더 안정적이었습니다. 한 HN 댓글 작성자는 "Gemma 4가 느낌은 더 좋지만, Qwen 3.5가 실사용은 더 낫다"로 요약했습니다. Llama 4와 비교하면, Gemma 4는 라이선스 개방성(Apache 2.0 vs Llama의 700M MAU 제한)과 배포 유연성(스마트폰부터 워크스테이션까지 vs Llama는 서버급만 가능)에서 뚜렷한 우위를 가집니다. DeepSeek V3.2와 비교했을 때, Zhihu 테스터들은 Gemma 4 31B의 품질이 "동등"하지만 파라미터 비용이 더 낮다고 평가했습니다. 특히 주목할 점은, 31B 모델이 경쟁 모델 대비 훨씬 적은 총 파라미터로 Kimi K2.5(744B-A40B) 및 GLM-5(1T-A32B)와 함께 글로벌 최정상급 오픈 모델에 나란히 이름을 올렸다는 것입니다.


결론: Gemma 4가 오픈 모델의 경쟁 구도를 재정의하다

Gemma 4는 단순한 기술 업그레이드가 아니라 Google 오픈소스 AI 전략의 근본적 전환입니다. 제한적 라이선스에서 Apache 2.0으로, 텍스트 전용에서 네 가지 모달리티로, 단일 Dense 아키텍처에서 Dense+MoE 이중 트랙 병행으로 -- 이러한 변화들의 시너지 효과가 Gemma 4를 2026년 현재까지 가장 주목받는 오픈 모델 출시 이벤트로 만들었습니다. 진정한 혁신은 단일 아키텍처 기술에 있는 것이 아니라, PLE, Shared KV Cache, p-RoPE, 128 소규모 전문가 MoE 등 이미 알려진 기술들의 정교한 조합에 있습니다. Zhihu의 한 기술 분석가가 언급한 것처럼, "각 기법을 개별적으로 보면 새로운 것이 없지만, 조합하면 확실히 강력하다." Sebastian Raschka의 분석도 이를 뒷받침합니다 -- 31B의 아키텍처는 Gemma 3과 거의 변하지 않았으며, 성능 도약은 주로 학습 레시피와 데이터 개선에서 비롯되었습니다.

향후 전망과 관련해, 커뮤니티는 여전히 세 가지를 기다리고 있습니다: 소문으로 돌았던 120B+ MoE 모델의 출시 여부, 파인튜닝 도구 체인의 안정성 개선 시점, 그리고 AWS Bedrock과 Azure 등 주요 클라우드 플랫폼의 네이티브 통합 시점. Nathan Lambert의 판단이 아마도 가장 정확할 것입니다: "Gemma 4의 성패는 전적으로 사용 편의성에 달려 있다... 벤치마크 점수가 아니라." 출시 후 겨우 일주일이 지났고 생태계는 아직 성숙 과정에 있지만, 방향은 이미 분명합니다 -- Google은 마침내 오픈 모델 영역에서 자신만의 리듬을 찾았습니다.