Gemini 3 Flash Dynamic Thinking: 현재 모델명·수명 주기·벤치마크 정리
Gemini 3 Flash의 Dynamic Thinking, 공식 벤치마크와 가격을 다시 확인하고, 현재 안정판 Gemini 3.6 Flash로 옮길지 판단하는 실전 가이드입니다.
핵심 요약
- Gemini 3 Flash는 2025년 12월 gemini-3-flash-preview로 출시됐으며, 현재 권장 대체 모델은 안정판 gemini-3.6-flash입니다
- Dynamic Thinking은 별도 모델을 고르는 라우터가 아니라 thinking_level로 품질·지연·비용의 상한을 조절하는 추론 방식입니다
- 출시 벤치마크와 현재 모델의 점수는 평가셋·하네스가 다르므로, 실제 프롬프트의 품질·지연·총 토큰 비용을 함께 측정해야 합니다
먼저 바로잡을 점: Gemini 3 Flash는 현재 최신 안정판이 아니다
Google은 2025년 12월 17일 Gemini 3 Flash를 공개했습니다. 당시 제품명은 “Gemini 3 Flash”였지만 개발자가 호출하는 정확한 API 모델 ID는 **gemini-3-flash-preview**였습니다. Google의 출시 공지도 API와 Vertex AI에서 Preview로 제공된다고 명시합니다.
2026년 7월 현재 상황은 달라졌습니다. Google의 Gemini API 모델 수명 주기 표에 따르면 gemini-3-flash-preview의 종료일은 아직 발표되지 않았지만, 권장 대체 모델은 **gemini-3.6-flash**입니다. gemini-3.6-flash는 2026년 7월 21일 출시된 GA(일반 제공) 안정판입니다.
| 구분 | 정확한 모델 ID | 현재 단계 | 권장 용도 |
|---|---|---|---|
| 원래 Gemini 3 Flash | gemini-3-flash-preview | Preview, 종료일 미정 | 기존 동작 재현, 제한된 비교 실험 |
| 현재 주력 Flash | gemini-3.6-flash | GA, 종료일 미정 | 코딩·에이전트·멀티모달 프로덕션 |
| 현재 비용 최적화형 | gemini-3.5-flash-lite | GA, 종료일 미정 | 대량 추출·분류·단순 자동화 |
따라서 “Gemini 3 Flash가 현재 최신 Flash” 또는 “정식 안정판”이라는 표현은 정확하지 않습니다. 앱 화면의 “Flash”라는 제품 라벨과 API의 버전 고정 모델 ID도 구분해야 합니다.
Dynamic Thinking은 무엇인가
Gemini 3 계열은 기본적으로 입력에 따라 생각하는 양을 조절합니다. 개발자는 thinking_level로 모델의 내부 추론 깊이에 대한 상대적 한도를 지정할 수 있습니다. 이는 토큰 수를 정확히 보장하는 예산도, 요청을 서로 다른 모델로 보내는 라우터도 아닙니다.
원래 gemini-3-flash-preview는 minimal, low, medium, high를 지원했고 기본값은 동적으로 작동하는 high였습니다. Google의 Gemini 3 개발자 가이드는 간단한 채팅·대량 처리에는 낮은 단계를, 복잡한 추론에는 높은 단계를 쓰도록 설명합니다. minimal도 복잡한 코딩 요청에서는 아주 적은 생각을 할 수 있으므로 “추론 완전 끄기”로 간주하면 안 됩니다.
실무에서는 다음처럼 해석하는 편이 안전합니다.
minimal또는low: 분류, 짧은 추출, 형식 변환처럼 정답 경로가 짧은 작업medium: 품질과 응답 시간의 균형이 필요한 일반적인 워크플로high: 복잡한 코딩, 여러 도구를 거치는 에이전트, 어려운 멀티모달 추론
현재 gemini-3.6-flash의 기본 thinking level은 medium입니다. 이전 Preview에서 기본값에 의존했다면 모델 ID만 바꾸지 말고, 동일한 평가 세트에서 medium과 high를 모두 측정해야 합니다.
기능: 멀티모달 이해와 생성 기능을 혼동하지 말 것
Gemini 3.6 Flash 모델 문서가 밝힌 입력 한도는 1,048,576토큰, 최대 출력은 65,536토큰입니다. 텍스트·이미지·비디오·오디오·PDF를 입력받지만 출력은 텍스트입니다.
지원 기능에는 캐싱, 코드 실행, 함수 호출, 파일 검색, 구조화 출력, URL 컨텍스트, Google Search·Maps grounding, thinking이 포함됩니다. Computer Use는 Preview 기능입니다. 반면 이 모델 자체의 이미지 생성, 오디오 생성, Live API는 지원하지 않습니다. “멀티모달 입력을 이해한다”와 “이미지·음성을 생성하거나 실시간 음성 대화를 한다”는 별개의 능력입니다.
이 구분은 아키텍처 선택에 직접 영향을 줍니다. 문서·영상 분석 후 JSON을 만드는 작업에는 3.6 Flash가 맞지만, 이미지 생성이나 실시간 음성 대화가 필요하면 해당 전용 Gemini 모델과 API를 별도로 선택해야 합니다.
가격: 원래 Preview가 더 싸지만 그것만으로 선택하면 안 된다
아래는 2026년 7월 26일 Gemini Developer API 공식 가격표의 유료 Standard 기준입니다. 금액은 100만 토큰당 미국 달러이며 출력 가격에는 thinking token이 포함됩니다.
| 모델 | 입력 | 출력 | 해석 |
|---|---|---|---|
gemini-3-flash-preview | $0.50 (텍스트·이미지·비디오), $1.00 (오디오) | $3.00 | 가장 저렴하지만 Preview |
gemini-3.6-flash | $1.50 | $7.50 | 안정판, 현재 권장 주력 Flash |
gemini-3.5-flash-lite | $0.30 | $2.50 | 대량·비용 민감 작업용 안정판 |
입력 단가만 보면 원래 Preview가 유리합니다. 하지만 Preview의 변경 가능성, 재검증·마이그레이션 비용, 모델별 출력 토큰 사용량까지 포함하면 총비용은 달라질 수 있습니다. 특히 Dynamic Thinking에서는 요청 수가 아니라 실제 입력·출력·thinking token과 지연 시간을 함께 기록해야 합니다.
벤치마크: “Pro를 이겼다”는 문장을 어디까지 믿을 수 있나
출시 당시 Google은 Gemini 3 Flash에 대해 다음 수치를 발표했습니다.
| 벤치마크 | Gemini 3 Flash 공식 발표값 | 조건 |
|---|---|---|
| GPQA Diamond | 90.4% | 과학 지식·추론 |
| Humanity’s Last Exam | 33.7% | 도구 미사용 |
| MMMU-Pro | 81.2% | 멀티모달 이해·추론 |
| SWE-bench Verified | 78.0% | 에이전트 코딩 |
같은 출시 공지는 SWE-bench Verified에서 Gemini 3 Pro보다 높았다고 설명했고, Gemini 2.5 Pro보다 3배 빠르다는 수치는 Artificial Analysis 측정에 근거했다고 밝혔습니다. 따라서 기존 글의 “5배 빠름”은 근거가 없어 삭제했습니다.
여기서 중요한 한계가 있습니다. 위 값은 Google이 공개한 출시 평가이며, 특정 벤치마크에서 한 모델을 앞섰다고 해서 모든 코딩·추론 작업에서 더 우수하다는 뜻은 아닙니다. 하네스, 도구, thinking level, 단일 시도 여부가 바뀌면 점수도 달라집니다.
현재 세대의 위치를 볼 때도 같은 원칙이 필요합니다. Google DeepMind의 Gemini 3.6 Flash 성능표는 SWE-Bench Pro 58.7%, Terminal-bench 2.1 78.0%, OSWorld-Verified 83.0%, 도구 미사용 CharXiv 85.2%를 보고합니다. 출시 때의 **SWE-bench Verified 78.0%**와 현재의 **SWE-Bench Pro 58.7%**는 이름과 평가 구성이 다른 벤치마크이므로 숫자만 나란히 놓고 성능이 하락했다고 판단하면 안 됩니다.
지금 어떤 Flash를 선택할까
새 프로덕션: gemini-3.6-flash
코드 생성, 여러 단계의 도구 사용, 차트·화면·문서 이해처럼 복합 작업이 중심이면 현재 GA 모델이 우선입니다. Google은 3.6 Flash가 3.5 Flash보다 추론 단계·대화 턴·도구 호출을 줄이고 코드 생성과 지시 준수를 개선했다고 설명합니다. 다만 시각 디자인 결과는 이전 모델을 선호한 인간 평가도 있었다고 밝히므로, UI 작업에는 디자인 규칙과 시각 회귀 검사를 함께 두는 편이 좋습니다.
대량·저비용 처리: gemini-3.5-flash-lite
문서에서 필드를 뽑거나 대량 분류·번역을 수행한다면 Flash-Lite가 더 합리적입니다. 복잡한 한 건의 최고 점수보다 처리량과 단가가 중요한 경우에 맞습니다.
기존 gemini-3-flash-preview: 유지보다 이전 계획
종료일은 아직 없지만 공식 권장 대체 모델이 이미 3.6 Flash입니다. 기존 결과를 재현해야 하는 비교 기간에는 유지할 수 있으나, 새 시스템의 기본 선택으로 삼기보다는 평가 데이터와 롤백 경로를 준비해 이전하는 편이 안전합니다.
3.6 Flash 마이그레이션 체크리스트
현재 Google 문서는 새 프로젝트에 google-genai SDK와 gemini-3.6-flash를 사용합니다.
from google import genai
client = genai.Client()
response = client.interactions.create(
model="gemini-3.6-flash",
input="이 계약서에서 갱신일과 해지 조건을 구조화해 주세요.",
generation_config={"thinking_level": "medium"},
)
print(response.output_text)
최신 모델 마이그레이션 가이드에 따라 다음도 함께 점검해야 합니다.
- 모델 ID를
gemini-3.6-flash로 고정합니다. temperature,top_p,top_k를 제거합니다. 최신 세대에서는 이 sampling parameter들이 deprecated 상태입니다.thinking_budget을thinking_level의medium또는high로 바꿉니다.- 지원하지 않는
candidate_count와 prefilled model turn을 제거합니다. - 함수 호출, thought signature, 멀티턴 대화의 회귀 테스트를 실행합니다.
- 대표 요청별 정확도, 첫 토큰 지연, 전체 지연, 입력·출력·thinking token을 함께 비교합니다.
결론
Gemini 3 Flash의 의미는 “저가 모델이 모든 Pro를 대체했다”가 아니라, Dynamic Thinking으로 지연·비용·추론 깊이의 균형을 애플리케이션이 조절할 수 있게 했다는 데 있습니다. 다만 2026년 7월의 실무 선택지는 출시 당시와 다릅니다.
새 프로덕션의 기본 후보는 GA인 gemini-3.6-flash, 대량 단순 작업은 gemini-3.5-flash-lite입니다. gemini-3-flash-preview는 역사적으로 중요한 모델이지만 현재는 공식 마이그레이션 대상입니다. 어떤 모델이 더 좋은지는 출시 홍보 문구보다 자체 데이터에서의 품질·지연·총 토큰 비용·운영 안정성으로 결정해야 합니다.
공식 참고자료
관련 글
이 글이 도움이 되셨나요?
공유하여 더 많은 분들에게 알려주세요.