실습 노트
Gemini 3.8 Flash의 ‘더 오래 생각하기’를 비용 설계로 읽는 법
Google이 설명한 Gemini 3.8 Flash의 추가 추론·반복 도구 호출을 토큰 단가가 아닌 작업 단위 비용으로 관리하는 방법을 정리합니다.
Google은 2026년 9월 2일 Gemini 3.8 Flash와 Gemini 3.8 Flash Cyber를 발표했습니다. 이번 발표에서 실무자가 주목할 표현은 단순히 “더 강한 모델”이 아니라 복잡한 작업에서 더 오래 일한다는 설명입니다. Google은 3.8 Flash가 추가 추론 단계를 거치고 도구를 반복 호출하며, 높은 effort 수준에서는 성능을 위해 더 많은 토큰을 사용할 수 있다고 적었습니다.

토큰 단가가 같아도 작업 비용은 달라진다
Google이 공개한 3.8 Flash의 도입 가격은 입력 100만 토큰당 0.75달러, 출력 100만 토큰당 3.75달러입니다. 이 가격은 2026년 12월 31일까지 적용되고, 2027년 1월 1일부터는 입력 1.50달러·출력 7.50달러로 바뀐다고 안내되어 있습니다. 이는 토큰 한 개의 가격이지, 에이전트 작업 한 건의 고정 가격은 아닙니다.
작업 단위 비용은 다음처럼 생각하는 편이 정확합니다.
작업 비용 = 입력 토큰 × 입력 단가
+ 출력 토큰 × 출력 단가
+ 재시도·도구 호출·추가 맥락에 따른 토큰
예를 들어 입력 10만 토큰과 출력 2만 토큰만 사용했다면 도입 가격 기준 계산값은 각각 0.075달러와 0.075달러로 합계 0.15달러입니다. 하지만 실제 에이전트는 실패한 도구 호출을 다시 시도하거나, 결과를 검토하기 위해 추가 호출을 만들 수 있습니다. 그러므로 API 호출 한 번의 단가보다 작업 ID별 총 토큰·호출 수·지연시간·재시도 횟수를 기록해야 합니다.
effort를 품질 옵션이 아니라 운영 옵션으로
3.8 Flash의 effort 수준은 결과 품질만 바꾸는 손잡이가 아닙니다. 낮은 effort는 토큰과 대기시간을 아끼는 선택이고, 높은 effort는 복잡한 다단계 문제에서 더 많은 추론과 도구 호출을 허용하는 선택입니다. 같은 모델을 모든 요청에 높은 effort로 고정하면 간단한 분류·추출 작업에도 긴 작업 비용을 지불할 수 있습니다.
업무를 세 구간으로 나누면 시작하기 쉽습니다.
- 짧은 작업: 정해진 형식의 추출·분류·간단한 답변은 낮은 effort와 작은 맥락으로 처리합니다.
- 검토가 필요한 작업: 코드 변경, 여러 문서 비교, 데이터 검증은 중간 effort와 도구 호출 상한을 둡니다.
- 실패 비용이 큰 작업: 법무·재무·보안처럼 근거와 사람 검수가 필요한 작업은 높은 effort를 허용하되, 승인 전 자동 실행을 막습니다.
이 구분은 Google의 벤치마크 결과를 그대로 업무 성능으로 번역하는 것이 아닙니다. Google이 공개한 DeepSWE, HLE-Verified 등의 수치는 공급자가 보고한 평가 결과이므로, 실제 조직의 데이터·도구·권한을 포함한 별도 검증이 필요합니다.
3.7 Flash와의 역할 분담
Google은 효율성이 우선인 애플리케이션에서는 낮은 effort를 사용하거나 Gemini 3.7 Flash를 계속 사용할 수 있다고 안내합니다. 따라서 새 모델을 전면 교체하기보다 작업 라우터를 두는 방식이 현실적입니다.
- 입력의 작업 유형과 예상 난도를 먼저 분류합니다.
- 기본 경로는 낮은 effort로 시작하고, 불확실성·검증 실패·도구 오류가 있을 때만 상향합니다.
- 일정 토큰 수나 도구 호출 수를 넘으면 중지하고 사람에게 넘깁니다.
- 작업별 성공률과 총 비용을 비교해 effort 규칙을 조정합니다.
이렇게 하면 “가장 좋은 모델을 항상 호출”하는 정책 대신 필요한 순간에만 더 오래 생각하게 하는 정책을 만들 수 있습니다. 비용 상한은 모델 설정만으로 끝나지 않고, 재시도·컨텍스트 크기·도구 권한까지 포함해야 합니다.
Gemini 3.8 Flash Cyber는 별도 접근 모델이다
Gemini 3.8 Flash Cyber는 일반 개발자가 바로 선택하는 공개 모델로 설명되지 않았습니다. Google은 Fairwind Program을 통해 정부·중요 인프라 운영자·소프트웨어 유지관리자 등 신뢰된 방어 조직에 우선 접근을 제공한다고 밝혔습니다. 참여 조직은 내부 사이버보안·사고 대응·침투 테스트 팀으로 접근을 제한하고 다중 인증을 사용하는 운영 기준에도 동의해야 합니다.
보안 자동화에 관심이 있더라도 이 발표를 “취약점 자동 수정 권한이 일반 공개됐다”로 읽으면 안 됩니다. 일반 조직은 현재 권한 범위와 승인 흐름을 먼저 설계하고, 공개 모델이나 기존 보안 도구로 재현 가능한 검증부터 시작해야 합니다.
적용 전 체크리스트
- 작업별 최대 입력·출력 토큰과 최대 도구 호출 수를 정했는가
- effort를 올리는 조건과 중단 조건이 로그에 남는가
- 재시도 비용을 원래 작업 비용과 합산하는가
- 모델·프롬프트·도구 버전이 결과와 함께 저장되는가
- 자동 실행 전 사람이 근거와 변경 내용을 확인하는가
- 2026년 말 가격 전환을 포함한 예산 시나리오가 있는가
Gemini 3.8 Flash의 핵심 신호는 낮은 단가 자체보다, 모델이 복잡한 작업에서 계산과 도구 사용을 스스로 늘릴 수 있다는 점입니다. 에이전트 도입에서는 모델 선택표보다 작업 단위의 비용·시간·검수 측정표가 먼저 필요합니다.