Gemini 3.6 Flash & Tiered Thinking: Google đã quên Gemini 3.5 Pro?

Gemini 3.6 Flash & Tiered Thinking: Google đã quên Gemini 3.5 Pro?

Mục lục

Google vừa lặng lẽ cập nhật hệ sinh thái AI của mình với sự xuất hiện của Gemini 3.6 Flash. Đợt phát hành này không chỉ mang đến tốc độ phản hồi đáng kinh ngạc và chi phí suy luận (inference cost) tối ưu hơn, mà còn giới thiệu một tùy chọn cấu hình suy luận hoàn toàn mới trong API và Google AI Studio: Tiered Thinking.

Tuy nhiên, điều khiến giới kỹ sư backend và các nhà nghiên cứu AI đặc biệt chú ý lại là một sự vắng mặt kỳ lạ: Gemini 3.5 Pro vẫn hoàn toàn bặt vô âm tín. Trong khi dòng Flash đã tiến thẳng từ 3.0 lên 3.6, dòng Pro vẫn giậm chân tại chỗ ở phiên bản 3.1 Pro.

Bài viết này sẽ mổ xẻ chi tiết cơ chế hoạt động bên dưới (under the hood) của Tiered Thinking, phân tích tại sao đây là bước chuyển mình quan trọng đối với các AI Agent hiện đại như Antigravity hay Claude Code, đồng thời giải mã bí ẩn đằng sau quyết định “bỏ quên” Gemini 3.5 Pro của Google.


1. Đặt vấn đề: Cuộc khủng hoảng của “Hardcoded Thinking Budget”

Trong nửa đầu năm 2025, khi các mô hình ngôn ngữ lớn bước vào thời kỳ suy luận chuỗi tư duy (Chain-of-Thought - CoT), các nhà cung cấp API như OpenAI hay Google đã cung cấp các tham số cho phép developer điều chỉnh dung lượng suy luận (Thinking Budget).

Đối với các dòng Gemini Flash trước đây, chúng ta thường làm việc với 3 preset cố định:

  • Low: Dùng từ 512 đến 1.024 thinking tokens. Phù hợp cho các tác vụ đơn giản như format JSON, autocomplete code hoặc phân loại text. Tốc độ cực nhanh, phản hồi gần như ngay lập tức.
  • Medium: Dùng khoảng 2.048 đến 4.096 thinking tokens. Cân bằng giữa tốc độ và khả năng lập luận cho các câu hỏi logic vừa phải.
  • High: Cho phép mô hình mở rộng chuỗi CoT lên tới 8.192 - 16.384 tokens. Dùng cho các bài toán phân tích thuật toán, tìm lỗi race condition trong Go goroutines hay refactor mô hình dữ liệu phức tạp.
{
  "model": "gemini-3.0-flash",
  "generationConfig": {
    "thinkingConfig": {
      "thinkingBudget": "high"
    }
  }
}

Bài toán thực tế của AI Agent Builder

Khi xây dựng các hệ thống tự động hóa hoặc AI Coding Agent chạy trên môi trường production, việc hardcode một mức thinkingBudget cố định lộ rõ những bất cập nghiêm trọng:

  1. Lãng phí chi phí và tăng độ trễ (Latency Spike): Nếu bạn cài mặc định high cho toàn bộ agent loop, những turn tương tác đơn giản (như đọc file, xác nhận đường dẫn hoặc phản hồi câu hỏi ngắn) vẫn ngốn hàng nghìn thinking token. Điều này làm độ trễ vòng lặp (loop latency) vọt lên 10-15 giây cho mỗi bước, khiến trải nghiệm người dùng trở nên chậm chạp và hóa đơn API tăng vọt.
  2. Nguy cơ suy giảm chất lượng (Under-thinking Hallucination): Ngược lại, nếu chọn low hoặc medium để tiết kiệm chi phí, agent sẽ bị “ngáo” ngay lập tức khi gặp các task yêu cầu phân tích sự phụ thuộc giữa nhiều file (cross-file dependency) hoặc suy luận logic nhiều bước.

Đó chính là động lực để Google trình làng Tiered Thinking trên Gemini 3.6 Flash.


2. Mổ xẻ “Tiered Thinking”: Cơ chế suy luận động under the hood

Khác với việc ép mô hình tuân theo một hạn mức token cố định, Tiered Thinking (thinkingBudget: "tiered") biến quỹ thời gian suy luận của AI thành một tài nguyên linh hoạt có khả năng tự điều chỉnh (Dynamic Token Allocation).

                      +-------------------+
                      |   User Prompt /   |
                      |   Agent Request   |
                      +---------+---------+
                                |
                                v
                      +-------------------+
                      | Pre-flight Router | (Phân tích độ khó)
                      +---------+---------+
                                |
        +-----------------------+-----------------------+
        |                       |                       |
        v                       v                       v
+---------------+       +---------------+       +---------------+
| Tier 1: Low   |       | Tier 2: Mid   |       | Tier 3: High  |
| (~512 tokens) |       | (~2K tokens)  |       | (~8K+ tokens) |
+-------+-------+       +-------+-------+       +-------+-------+
        |                       |                       |
        +-----------------------+-----------------------+
                                |
                                v
                      +-------------------+
                      | Final Response /  |
                      |  Tool Call Output |
                      +-------------------+

Nguyên lý vận hành 3 bước của Tiered Thinking

  1. Tiền phân tích độ khó (Pre-flight Complexity Routing): Ngay khi request cập bến, một router siêu nhẹ (gần như có độ trễ bằng 0) hoặc chính các layer đầu tiên của Gemini 3.6 Flash sẽ đánh giá độ phức tạp của bài toán dựa trên các chỉ số như: số lượng token trong context, mật độ cấu trúc code, và độ mập mờ của chỉ thị (prompt ambiguity).
  2. Phân tầng xử lý linh hoạt (Tier Routing):
    • Tier 1 (Lightweight): Nếu request chỉ là “Viết hàm helper validate email trong Go”, mô hình kích hoạt chuỗi CoT tối thiểu và trả về kết quả trong chưa đầy 500ms.
    • Tier 2 (Standard): Nếu request yêu cầu “Tối ưu câu truy vấn SQL JOIN 4 bảng có kèm GROUP BY”, mô hình phân bổ khoảng 2.000 thinking tokens để đánh giá index và thực thi plan.
    • Tier 3 (Deep Reasoning): Nếu prompt là “Phân tích deadlock tiềm ẩn giữa 3 channel trong hệ thống xử lý tin nhắn Go”, mô hình tự động mở rộng chuỗi CoT lên mức tối đa, đào sâu kiểm tra từng kịch bản cạnh tranh tài nguyên.
  3. Cơ chế ngắt sớm (Early Exit Threshold): Trong quá trình tạo CoT, nếu mô hình đạt tới mức độ tự tin (confidence score) vượt qua ngưỡng an toàn trước khi tiêu hết token dự kiến của tầng đó, nó sẽ ngay lập tức dừng quá trình suy luận và xuất ra response. Developer chỉ phải trả tiền cho đúng số token đã thực sự sinh ra.

Trải nghiệm lập trình với SDK chính thức từ Google

Info

Lưu ý quan trọng về Go SDK: Google đã chính thức đánh dấu Deprecated cho thư viện Go cũ (github.com/google/generative-ai-go) và hợp nhất toàn bộ hệ sinh thái GenAI (Gemini, Veo, Imagen) sang SDK hợp nhất chính thức: google.golang.org/genai (repo github.com/googleapis/go-genai). Hãy đảm bảo dự án của bạn sử dụng package import path mới này.

Dưới đây là ví dụ triển khai cấu hình Tiered Thinking trong các ứng dụng thực tế sử dụng Go SDK chính thức và Python SDK:

  • Go SDK (google.golang.org/genai)
  • Python SDK (google-genai)
package main

import (
	"context"
	"fmt"
	"log"

	"google.golang.org/genai"
)

func main() {
	ctx := context.Background()

	// Khởi tạo client sử dụng SDK chính thức mới google.golang.org/genai
	client, err := genai.NewClient(ctx, &genai.ClientConfig{
		APIKey: "YOUR_API_KEY",
	})
	if err != nil {
		log.Fatalf("Khởi tạo GenAI client thất bại: %v", err)
	}

	// Gọi mô hình Gemini 3.6 Flash với cấu hình suy luận phân tầng
	resp, err := client.Models.GenerateContent(
		ctx,
		"gemini-3.6-flash",
		genai.Text("Hãy kiểm tra đoạn code Go này có rò rỉ goroutine không..."),
		&genai.GenerateContentConfig{
			Temperature: genai.Ptr[float64](0.2),
			ThinkingConfig: &genai.ThinkingConfig{
				IncludeThoughts: true,
				ThinkingLevel:   genai.ThinkingLevelHigh, // Hoặc cấu hình tiered level
			},
		},
	)
	if err != nil {
		log.Fatalf("Lỗi khi gọi API Gemini 3.6: %v", err)
	}

	// In ra kết quả phản hồi từ mô hình
	fmt.Println(resp.Text())
}
from google import genai
from google.genai import types

# Khởi tạo Client với Google GenAI SDK mới
client = genai.Client(api_key="YOUR_API_KEY")

# Gọi mô hình Gemini 3.6 Flash với Tiered Thinking Config
response = client.models.generate_content(
    model="gemini-3.6-flash",
    contents="Viết một hàm Python thực hiện thuật toán A* để tìm đường đi ngắn nhất trên đồ thị có trọng số.",
    config=types.GenerateContentConfig(
        temperature=0.2,
        thinking_config=types.ThinkingConfig(
            include_thoughts=True,
            thinking_level="HIGH"  # Hoặc "TIERED"
        )
    )
)

print(response.text)

Tip

Kinh nghiệm cho Agent Builder: Khi sử dụng thinkingBudget: "tiered" trong các vòng lặp Agentic Coding, bạn nên thiết lập thời gian timeout của HTTP Client tối thiểu là 45-60 giây. Mặc dù các tác vụ dễ phản hồi rất nhanh, nhưng khi đụng phải tác vụ khó thuộc Tier 3, mô hình sẽ dành thêm thời gian suy nghĩ CoT trước khi trả về chuỗi response chính thức.


3. Bí ẩn “Gemini 3.5 Pro bặt vô âm tín”: Đâu là lý do thực sự?

Nhìn lại lộ trình phát triển của Google, chúng ta có một đường cong thế hệ kỳ lạ:

Dòng sản phẩmThế hệ 3.0Thế hệ 3.1 / 3.5Thế hệ 3.6
Gemini Flash3.0 Flash (12/2024)3.5 Flash-Lite (03/2025)3.6 Flash (07/2026)
Gemini Pro3.0 Pro (01/2025)3.1 Pro (04/2025)Missing in Action (?)

Tại sao Google lại “bỏ quên” mốc Gemini 3.5 Pro? Giới chuyên gia và cộng đồng kỹ sư AI đang đưa ra 4 giả thuyết có cơ sở kỹ thuật sau:

Giả thuyết 1: Gemini 3.6 Flash “Tiered” chính là 3.5 Pro được chắt lọc (Distilled Model)

Trong kỹ thuật huấn luyện LLM, Knowledge Distillation (chắt lọc tri thức) là phương pháp dùng một mô hình lớn (Teacher Model) để huấn luyện cho một mô hình nhỏ hơn (Student Model) đạt được hiệu năng tiệm cận nhưng với chi phí máy chủ thấp hơn nhiều lần.

Có nhiều bằng chứng soi từ API endpoint cho thấy gemini-3.6-flash-tiered thực chất chính là kết quả của việc distill từ dự án 3.5 Pro nội bộ của Google. Thay vì phát hành 3.5 Pro dưới dạng một API riêng đắt đỏ, Google đã quyết định đóng gói toàn bộ năng lực lập luận đó vào dòng Flash 3.6 và tích hợp sẵn cơ chế Tiered Router.

Giả thuyết 2: Bài toán kinh tế hạ tầng (Inference Economics of TPU)

Chi phí vận hành (Cost-to-Serve) một mô hình Pro cỡ lớn cho hàng triệu lượt request mỗi ngày trên hạ tầng TPU v5e/v6e là cực kỳ tốn kém. Trong bối cảnh cuộc đua giá API đang ngày càng khốc liệt:

  • Một request đến mô hình Pro có thể tiêu tốn tài nguyên tính toán gấp 5-8 lần so với mô hình Flash.
  • Nếu Gemini 3.6 Flash với Tiered Thinking đã giải quyết được 95% các bài toán lập trình và lập luận thông thường với chi phí cực rẻ, việc duy trì một mô hình “Gemini 3.5 Pro” ở giữa sẽ trở thành một sản phẩm dư thừa, khó định giá và tự dẫm chân lên các dòng sản phẩm của chính Google.

Giả thuyết 3: Sự dịch chuyển paradigm sang “Loop Latency” trong AI Coding Agent

Khi làm việc với các hệ thống AI Agent thế hệ mới như Antigravity hay Claude Code, các kỹ sư nhận ra rằng Độ trễ vòng lặp (Loop Latency) mới là yếu tố quyết định trải nghiệm, chứ không phải một vài điểm phần trăm chênh lệch trên các bài test benchmark lý thuyết.

Một AI Agent khi refactor code thường phải trải qua 10-15 turn tương tác (đọc file, tìm vị trí hàm, sửa code, chạy linter, chạy unit test, sửa lại).

  • Nếu dùng mô hình Pro nặng nề: Mỗi turn mất 20 giây -> Tổng thời gian chờ: 5 phút.
  • Nếu dùng Gemini 3.6 Flash Tiered: Các turn đọc/xác nhận mất 1 giây, chỉ turn suy luận sâu mới mất 8 giây -> Tổng thời gian chờ: dưới 40 giây.

Tốc độ này giúp developer giữ được trạng thái tập trung (flow state). Google hiểu rõ điều này nên đã tập trung toàn bộ nguồn lực để biến 3.6 Flash thành “vũ khí tối thượng” cho Agentic Coding.

Giả thuyết 4: Google dồn lực dội bom với Gemini 4.0 Pro

Giả thuyết cuối cùng và cũng đầy triển vọng: Google không hề hủy bỏ dòng Pro, mà họ quyết định bỏ qua mốc 3.5 để dồn toàn bộ dữ liệu huấn luyện và kiến trúc Multimodal/Spatial Reasoning mới nhất cho bước nhảy vọt Gemini 4.0 Pro. Quyết định nhảy cóc này từng được Google áp dụng ở một số dòng sản phẩm hạ tầng Cloud khi nâng cấp phiên bản lớn.


4. So sánh thực chiến: Khi nào nên dùng cấu hình nào?

Để giúp bạn lựa chọn đúng cấu hình cho dự án production, dưới đây là bảng tổng hợp khuyến nghị kịch bản sử dụng cho Gemini 3.6 Flash:

Tham số ThinkingLatency trung bìnhChi phí ước tínhĐộ chính xác logicKịch bản sử dụng tối ưu
Low~300ms - 800msSiêu rẻ ($)Khá (cho task dễ)Autocomplete code, format JSON response, sinh SQL CRUD đơn giản, viết comment code.
Medium~1.5s - 3.0sTiết kiệm ($$)TốtViết hàm xử lý logic kinh doanh (Business logic), viết Unit Test, giải thích luồng code ngắn.
High~6.0s - 15.0sCao ($$$)Rất caoPhân tích Security Audit, tìm race condition/memory leak, thiết kế schema hệ thống phân tán.
TieredDynamic (~500ms - 8s)Tối ưu nhất ($$-$$$)Tự thích ứngKhuyến nghị mặc định cho AI Agents, Pipeline xử lý hỗn hợp, Chatbot hỗ trợ kỹ thuật tự động.

5. Lời kết

Sự ra mắt của Gemini 3.6 Flash cùng tùy chọn Tiered Thinking đánh dấu một bước tiến quan trọng trong tư duy thiết kế sản phẩm API của Google. Thay vì bắt developer phải đau đầu làm các bài toán benchmark để chọn ngân sách suy luận thủ công, hệ thống đã tự biết cách cân bằng giữa tốc độ và trí tuệ.

Dù số phận của Gemini 3.5 Pro có chìm vào quên lãng hay trở thành tiền đề cho Gemini 4.0 Pro bùng nổ trong tương lai, thì ở góc độ người dùng và lập trình viên, việc có trong tay một mô hình 3.6 Flash nhanh, thông minh và cực kỳ linh hoạt như hiện tại đã là một tin rất vui.

Bạn đã trải nghiệm Gemini 3.6 Flash với Tiered Thinking trên Antigravity hay Google AI Studio chưa? Hãy để lại ý kiến của bạn ở phần bình luận bên dưới nhé!

Chia sẻ :

Bài viết liên quan

LeanCTX: Cỗ máy context engineering cho AI agent - không chỉ là nén token

LeanCTX: Cỗ máy context engineering cho AI agent - không chỉ là nén token

Mở đầu: cái ngày mình nhận ra mình đang đổ xăng máy bay cho con Wave Chuyện là thế này.

Đọc thêm
Headroom vs Aphrodite: Cuộc chiến nén context - LLM của bạn đang đốt 90% token vào rác

Headroom vs Aphrodite: Cuộc chiến nén context - LLM của bạn đang đốt 90% token vào rác

80 đô một bookmark Hồi tháng 4, mình đang ngồi debug cái trace sao service menu bắn ra 500. Claude Code chạy, gửi cái stack trace vào, load file service, rồi gửi file gateway, rồi gửi thêm DB schema. 3 giây sau - bing - nó trả lời. Đọc xong mình chỉ biết ngồi im.

Đọc thêm