Gemini 3.6 Flash là gì và tại sao Google lại phát hành nó trước Gemini Pro? Google đã giới thiệu Gemini 3.6 Flash và Gemini 3.5 Flash-Lite vào tháng 7 năm 2026 như các mô hình API Gemini chi phí thấp dành cho khối lượng công việc lớn của nhà phát triển. Việc ra mắt này nhấn mạnh vào yếu tố định giá, hiệu suất token và các cân nhắc triển khai khi các nhà phát triển ngày càng xây dựng nhiều tác nhân lập trình và quy trình tự động hóa hơn.

Ra mắt Google Gemini 3.6 Flash: Có gì thay đổi?
Tổng quan
- Google giới thiệu Gemini 3.6 Flash và Gemini 3.5 Flash-Lite như các mô hình chi phí thấp được tối ưu hóa cho khối lượng công việc lớn của nhà phát triển.
- Các phép đo điểm chuẩn được báo cáo cho thấy hiệu suất token được cải thiện, bao gồm mức tiêu thụ token đầu ra thấp hơn tới 17% so với Gemini 3.5 Flash.
- Gemini Pro vẫn chưa được cung cấp rộng rãi ra công chúng, trong khi các mô hình Flash đại diện cho bước triển khai hiện tại của Google tập trung vào nhà phát triển.
Việc mở rộng sản phẩm của Google giới thiệu hai tầng mô hình phù hợp cho nhu cầu sử dụng lớn của nhà phát triển. Gemini 3.6 Flash đóng vai trò là mô hình nhà phát triển tổng quát chính cho lập trình, phân tích tài liệu và các tác vụ có tính tác nhân (agentic tasks). Song song đó, Google đã giới thiệu Gemini 3.5 Flash-Lite, được thiết kế như một mô hình nhẹ, tốc độ cao cho các công việc đòi hỏi độ trễ thấp.
Các mô hình này hiện có sẵn thông qua các nền tảng dành cho nhà phát triển của Google, bao gồm Google AI Studio, Android Studio và Vertex AI. Google cũng đang mở rộng các mô hình thuộc dòng Flash trên khắp các sản phẩm AI và hệ sinh thái dành cho nhà phát triển của mình.

Định giá API và hiệu suất token của Gemini 3.6 Flash
Cấu trúc chi phí là yếu tố trọng tâm của đợt ra mắt mới này. Google liệt kê định giá API Gemini 3.6 Flash ở mức $1.50 cho mỗi triệu token đầu vào và $7.50 cho mỗi triệu token đầu ra. Đối với các công việc nhẹ hơn, Gemini 3.5 Flash-Lite giảm chi phí đầu vào xuống $0.30 cho mỗi triệu token và chi phí đầu ra xuống $2.50 cho mỗi triệu token.
Bảng dưới đây phác thảo định giá và các khối lượng công việc mục tiêu trên các tầng mô hình Flash mới:
| Mô hình | Định giá đầu vào | Định giá đầu ra | Khối lượng công việc mục tiêu |
|---|---|---|---|
| Gemini 3.6 Flash | $1.50 / 1 triệu token | $7.50 / 1 triệu token | Quy trình tác nhân, lập trình, tự động hóa đa bước |
| Gemini 3.5 Flash-Lite | $0.30 / 1 triệu token | $2.50 / 1 triệu token | Tác vụ khối lượng lớn, phân tích tài liệu, tổng hợp tìm kiếm |
Theo các đánh giá được Google công bố, Gemini 3.6 Flash giảm mức sử dụng token đầu ra lên đến 17% so với Gemini 3.5 Flash. Các điểm chuẩn bên ngoài từ Artificial Analysis báo cáo rằng Gemini 3.5 Flash-Lite đạt tốc độ xử lý lên tới 350 token đầu ra mỗi giây, như đã trình bày chi tiết trong các thông báo chính thức về sản phẩm.

Điểm chuẩn Gemini 3.6 Flash: Hiệu suất lập trình và tác nhân
Trên các điểm chuẩn kỹ thuật phần mềm, các đánh giá của Google cho thấy tỷ lệ hoàn thành tác vụ được cải thiện trong các đánh giá DeepSWE với ít chỉnh sửa mã không mong muốn hơn. Những kết quả này cho thấy những cải tiến trong các tác vụ lập trình tự động và quy trình kỹ thuật phần mềm.
Ngoài ra, mô hình còn chứng minh khả năng sử dụng máy tính được cải thiện trong các đánh giá OSWorld-Verified, đạt 83.0% so với 78.4% của Gemini 3.5 Flash. Đối với các tác vụ dựa trên kiến thức, mô hình đạt 1421 trên GDPval-AA v2, thể hiện khả năng suy luận mạnh mẽ hơn trong các tác vụ đa phương thức phức tạp như phân tích biểu đồ và soạn thảo tài liệu.

Gemini 3.6 Flash so với Gemini Pro: Tính khả dụng và lựa chọn mô hình
Trong khi các mô hình Flash có sẵn rộng rãi thông qua các nền tảng API, Gemini Pro vẫn bị giới hạn khả năng tiếp cận và Google chưa công bố lộ trình chi tiết cho việc truy cập rộng rãi hơn.
Bảng dưới đây so sánh vị thế cốt lõi giữa các tầng mô hình Flash và Pro:
| Chỉ số hoặc tính năng | Tầng Gemini Flash | Tầng Gemini Pro |
|---|---|---|
| Mục đích chính | Khối lượng công việc tác nhân và lập trình lớn | Suy luận chuyên sâu đơn lượt phức tạp |
| Định giá API | Có định giá công khai ($1.50 / $7.50) | Định giá không được công bố rộng rãi |
| Trọng tâm hiệu suất | Tối ưu hóa cho thông lượng và hiệu suất | Tối ưu hóa cho khả năng suy luận nâng cao |
| Quyền truy cập hiện tại | Có sẵn qua các nền tảng API | Khả năng tiếp cận hạn chế |
Mô hình triển khai này cung cấp cho các nhà phát triển quyền truy cập vào các mô hình Flash chi phí thấp trước khi Gemini Pro có khả năng tiếp cận rộng hơn. Đối với các khối lượng công việc sản xuất đòi hỏi các lệnh gọi công cụ tuần tự và thực thi tự động, các mô hình Flash mang lại sự cân bằng tức thì về tốc độ và khả năng chi trả.
Tại sao các nhà phát triển cần các mô hình AI chi phí thấp cho quy trình tác nhân
Gemini 3.6 Flash nhắm trực tiếp vào thách thức chi phí do các khối lượng công việc tác nhân tạo ra, nơi các tác nhân lập trình và hệ thống tự động hóa tạo ra các lệnh gọi API lặp đi lặp lại trong quá trình thực thi. Không giống như các truy vấn người dùng đơn lượt, các tác nhân tự chủ hoạt động trong các vòng lặp thực thi đa bước:
[Vòng lặp suy luận nguyên khối nặng nề] Truy vấn người dùng ──> Mô hình nguyên khối ──> Nhiều token đầu ra + Độ trễ ──> Chi phí API tăng cao [Vòng lặp thực thi tác nhân Flash] Truy vấn người dùng ──> Mô hình dòng Flash ──> Ít token đầu ra hơn ──> Chi phí API thấp hơn trên mỗi tác vụ
Trong một vòng lặp tác nhân, mô hình nhận một câu lệnh, thực hiện một lệnh gọi công cụ, nhận đầu ra và lặp lại chu kỳ. Vì mỗi lần lặp tác nhân đòi hỏi các lệnh gọi mô hình bổ sung và các token được tạo, các quy trình đa bước có thể làm tăng mức tiêu thụ API một cách nhanh chóng. Bằng cách giảm bớt sự rườm rà và số lượng token đầu ra, Gemini 3.6 Flash cho phép các ứng dụng doanh nghiệp chạy các quy trình tự động với chi phí API có thể dự đoán được.
Từ chi phí suy luận AI đến hiệu quả ứng dụng
Những thách thức hiệu quả tương tự cũng xuất hiện trong các ứng dụng di động, nơi các nhà phát triển cần bảo toàn bối cảnh thu hút người dùng trong khi giảm bớt quá trình xử lý không cần thiết ở phía máy khách. Các nền tảng phân bổ phía máy chủ giải quyết vấn đề cơ sở hạ tầng tương tự bằng cách bảo toàn bối cảnh chuyển đổi xuyên suốt hành trình người dùng phân mảnh. OpoInstall cung cấp các khả năng này cho các nhóm tăng trưởng di động. Các hệ thống này giúp duy trì bối cảnh chuyển đổi trong suốt quá trình cài đặt ứng dụng và hành trình người dùng trong khi giảm độ phức tạp phía máy khách.
Danh sách kiểm tra cho nhà phát triển khi triển khai Gemini Flash
Để tối ưu hóa chi phí vận hành và đảm bảo hiệu suất hệ thống đáng tin cậy khi triển khai các mô hình Flash, các nhóm kỹ thuật và sản phẩm nên áp dụng các hướng dẫn tích hợp có cấu trúc.
Kỹ thuật API
- Giám sát mức tiêu thụ token: Kiểm tra số lượng token đầu vào và đầu ra trên mỗi yêu cầu tác nhân đa lượt để theo dõi chi phí thực thi.
- Thiết lập giới hạn thực thi tác nhân: Thực thi mức trần lặp lại lệnh gọi công cụ tối đa để ngăn chặn các vòng lặp thực thi vô hạn.
- Bộ nhớ đệm bối cảnh lặp lại: Tận dụng bộ nhớ đệm câu lệnh (prompt caching) rõ ràng để tránh việc xử lý lại các chỉ dẫn hệ thống tĩnh và các câu lệnh cố định.
Nhóm sản phẩm
- Đo lường chi phí trên mỗi quy trình: Kiểm tra mức tiêu thụ token API trên mỗi người dùng đang hoạt động để đảm bảo rằng các tính năng sản phẩm vẫn mang lại lợi nhuận.
- Theo dõi độ trễ và thông lượng: Giám sát thời gian khứ hồi API và tốc độ tạo token đầu ra trên các tác vụ thực thi đa bước.
- Đánh giá ROI qua các tầng: So sánh chất lượng hoàn thành tác vụ với chi phí token trước khi quyết định nâng cấp lên các tầng mô hình lớn hơn.
Các câu hỏi thường gặp (FAQ)
Gemini 3.6 Flash là gì?
Gemini 3.6 Flash được sử dụng để làm gì?
Gemini 3.6 Flash hiện đã có sẵn chưa?
Gemini 3.6 Flash có miễn phí không?
Định giá API Gemini 3.6 Flash là bao nhiêu?
Gemini 3.6 Flash so với Gemini Pro: Sự khác biệt là gì?
Tại sao Google phát hành Flash trước Pro?
Những điểm chính cho các nhóm kỹ thuật
Gemini 3.6 Flash định vị dòng Flash của Google như một lựa chọn chi phí thấp cho các nhà phát triển đang xây dựng các ứng dụng AI trong môi trường sản xuất, trong khi Gemini Pro vẫn tập trung vào các kịch bản suy luận đòi hỏi khả năng cao hơn. Việc ra mắt cho thấy dòng Flash của Google đang nhắm mục tiêu triển khai AI ở quy mô sản xuất, nơi hiệu quả chi phí và độ tin cậy đang trở nên quan trọng không kém khả năng của mô hình. Đối với các nhà phát triển, quyết định then chốt không còn chỉ dựa trên khả năng của mô hình mà còn là liệu mô hình đó có thể mang lại hiệu suất đáng tin cậy ở quy mô sản xuất với chi phí có thể dự đoán được hay không.
Share this article



