Google Gemini 3.6 Flash: Harga API, Penanda Aras & Status Pro

opoinstall
2026-07-22
5 min read

Apakah itu Gemini 3.6 Flash, dan mengapa Google melancarkannya sebelum Gemini Pro? Google memperkenalkan Gemini 3.6 Flash dan Gemini 3.5 Flash-Lite pada Julai 2026 sebagai model API Gemini berkos lebih rendah untuk beban kerja pembangun yang berisipadu tinggi. Pelancaran ini mengetengahkan aspek harga, kecekapan token, dan pertimbangan penggunaan semasa para pembangun membina lebih banyak ejen pengekodan serta aliran kerja automatik.

Grafik kulit Gemini 3.6 Flash yang menggambarkan barisan model baharu

Pelancaran Google Gemini 3.6 Flash: Apa yang Berubah?

Imbasan Pantas

  • Google memperkenalkan Gemini 3.6 Flash dan Gemini 3.5 Flash-Lite sebagai model berkos rendah yang dioptimumkan untuk beban kerja pembangun yang berisipadu tinggi.
  • Pengukuran penanda aras yang dilaporkan menunjukkan kecekapan token yang lebih baik, termasuk penggunaan token output sehingga 17% lebih rendah berbanding Gemini 3.5 Flash.
  • Gemini Pro masih belum mencapai ketersediaan awam secara meluas, sementara model Flash mewakili pelancaran tertumpu-pembangun Google pada masa kini.

Perluasan produk Google memperkenalkan dua peringkat model yang disesuaikan untuk kegunaan pembangun berisipadu tinggi. Gemini 3.6 Flash berfungsi sebagai model pembangun umum utama untuk pengekodan, penghuraian dokumen, dan tugasan ejen. Bersama dengannya, Google memperkenalkan Gemini 3.5 Flash-Lite, yang direka bentuk sebagai model berkapasiti tinggi dan ringan untuk beban kerja yang memerlukan kependaman rendah.

Model-model ini tersedia melalui platform pembangun Google, termasuk Google AI Studio, Android Studio, dan Vertex AI. Google juga sedang memperluaskan model kelas Flash merentasi produk AI dan ekosistem pembangunnya.

Penanda aras Gemini 3.5 Flash-Lite yang menunjukkan peningkatan kelajuan dan kecekapan

Harga API dan Kecekapan Token Gemini 3.6 Flash

Struktur kos merupakan elemen utama dalam pelancaran baharu ini. Google menyenaraikan harga API Gemini 3.6 Flash pada $1.50 bagi setiap sejuta token input dan $7.50 bagi setiap sejuta token output. Untuk beban kerja yang lebih ringan, Gemini 3.5 Flash-Lite menurunkan kos input kepada $0.30 bagi setiap sejuta token dan kos output kepada $2.50 bagi setiap sejuta token.

Jadual di bawah menggariskan harga dan beban kerja sasaran merentasi peringkat model Flash yang baharu:

Model Harga Input Harga Output Beban Kerja Sasaran
Gemini 3.6 Flash $1.50 / 1J token $7.50 / 1J token Aliran kerja ejen, pengekodan, automasi berbilang langkah
Gemini 3.5 Flash-Lite $0.30 / 1J token $2.50 / 1J token Tugasan berisipadu tinggi, penghuraian dokumen, sintesis carian

Menurut penilaian yang diterbitkan oleh Google, Gemini 3.6 Flash mengurangkan penggunaan token output sehingga 17% berbanding Gemini 3.5 Flash. Penanda aras luaran daripada Artificial Analysis melaporkan bahawa Gemini 3.5 Flash-Lite mencapai kelajuan pemprosesan sehingga 350 token output sesaat, seperti yang diperincikan dalam pengumuman produk rasmi.

Carta penanda aras kecekapan token Gemini 3.6 Flash yang menunjukkan pengurangan output

Penanda Aras Gemini 3.6 Flash: Prestasi Pengekodan dan Ejen

Pada penanda aras kejuruteraan perisian, penilaian Google menunjukkan kadar penyelesaian tugasan yang lebih baik dalam penilaian DeepSWE dengan suntingan kod yang tidak diingini yang lebih sedikit. Keputusan ini menunjukkan peningkatan dalam tugasan pengekodan automatik dan aliran kerja kejuruteraan perisian.

Selain itu, model ini menunjukkan keupayaan penggunaan komputer yang lebih baik pada penilaian OSWorld-Verified, dengan markah 83.0% berbanding 78.4% untuk Gemini 3.5 Flash. Untuk tugasan berasaskan pengetahuan, model ini memperoleh 1421 pada GDPval-AA v2, yang menunjukkan penaakulan yang lebih kukuh merentasi tugasan berbilang mod yang kompleks seperti analisis carta dan penggubalan dokumen.

Testimoni pembangun mengenai kecekapan token Gemini Flash

Gemini 3.6 Flash lwn Gemini Pro: Ketersediaan dan Pilihan Model

Walaupun model Flash tersedia secara meluas melalui platform API, Gemini Pro masih mempunyai ketersediaan yang terhad, dan Google tidak mendedahkan garis masa awam yang terperinci untuk akses yang lebih luas.

Jadual di bawah membandingkan kedudukan teras antara peringkat model Flash dan Pro:

Metrik atau Ciri Peringkat Gemini Flash Peringkat Gemini Pro
Tujuan Utama Beban kerja ejen berisipadu tinggi dan pengekodan Penaakulan mendalam satu-giliran yang kompleks
Harga API Harga awam tersedia ($1.50 / $7.50) Harga tidak tersedia secara meluas
Fokus Prestasi Dioptimumkan untuk kapasiti dan kecekapan Dioptimumkan untuk keupayaan penaakulan lanjutan
Akses Semasa Tersedia melalui platform API Ketersediaan Terhad

Corak pelancaran ini memberi pembangun akses kepada model Flash yang berkos lebih rendah sebelum Gemini Pro mencapai ketersediaan yang lebih luas. Bagi beban kerja pengeluaran yang memerlukan panggilan alat berjujukan dan pelaksanaan automatik, model Flash menawarkan keseimbangan kelajuan dan kemampuan yang segera.

Mengapa Pembangun Memerlukan Model AI Berkos Rendah untuk Aliran Kerja Ejen

Gemini 3.6 Flash menyasarkan terus cabaran kos yang diwujudkan oleh beban kerja ejen, di mana ejen pengekodan dan sistem automasi menjana panggilan API berulang semasa pelaksanaan. Tidak seperti pertanyaan pengguna satu-giliran, ejen autonomi beroperasi dalam gelung pelaksanaan berbilang langkah:

[Gelung Penaakulan Monolitik Berat]
  Pertanyaan Pengguna ──> Model Monolitik ──> Token Output Tinggi + Kependaman ──> Kos API Meningkat


[Gelung Pelaksanaan Ejen Flash]
  Pertanyaan Pengguna ──> Model Kelas Flash ──> Token Output Lebih Rendah ──> Kos API Setiap Tugasan Lebih Rendah

Dalam gelung ejen, model menerima gesaan, melaksanakan panggilan alat, menerima output, dan mengulangi kitaran tersebut. Kerana setiap lelaran ejen memerlukan panggilan model tambahan dan token yang dijana, aliran kerja berbilang langkah boleh meningkatkan penggunaan API dengan cepat. Dengan mengurangkan verbiage dan jumlah token output, Gemini 3.6 Flash membolehkan aplikasi perusahaan menjalankan aliran kerja automatik dengan perbelanjaan API yang boleh diramal.

Daripada Kos Inferens AI kepada Kecekapan Aplikasi

Cabaran kecekapan yang serupa juga muncul dalam aplikasi mudah alih, di mana pembangun perlu mengekalkan konteks pemerolehan sambil mengurangkan pemprosesan bahagian klien yang tidak perlu. Platform atribusi bahagian pelayan menyelesaikan masalah infrastruktur yang serupa dengan mengekalkan konteks penukaran merentasi perjalanan pengguna yang berpecah-pecah. OpoInstall menyediakan keupayaan ini untuk pasukan pertumbuhan mudah alih. Sistem ini membantu mengekalkan konteks penukaran merentasi pemasangan aplikasi dan perjalanan pengguna sambil mengurangkan kerumitan bahagian klien.

Senarai Semak Pembangun untuk Penggunaan Gemini Flash

Untuk mengoptimumkan kos operasi dan memastikan prestasi sistem yang boleh dipercayai semasa menggunakan model Flash, pasukan kejuruteraan dan produk harus menerima pakai garis panduan penyepaduan yang berstruktur.

Kejuruteraan API

  • Pantau Penggunaan Token: Audit kiraan token input dan output bagi setiap permintaan ejen berbilang giliran untuk menjejaki perbelanjaan pelaksanaan.
  • Tetapkan Had Pelaksanaan Ejen: Kuatkuasakan had lelaran panggilan alat maksimum untuk mengelakkan gelung pelaksanaan tanpa henti.
  • Cache Konteks Berulang: Gunakan caching gesaan eksplisit untuk mengelakkan pemprosesan semula arahan sistem statik dan gesaan tetap.

Pasukan Produk

  • Ukur Kos setiap Aliran Kerja: Audit penggunaan token API bagi setiap pengguna aktif untuk memastikan ciri produk kekal menguntungkan.
  • Jejaki Kependaman dan Kapasiti: Pantau masa pergi-balik API dan kelajuan penjanaan token output merentasi tugasan pelaksanaan berbilang langkah.
  • Nilai ROI Merentasi Peringkat: Penanda aras kualiti penyelesaian tugasan terhadap kos token sebelum memutuskan untuk menaik taraf kepada peringkat model yang lebih besar.

Soalan Lazim (FAQ)

Apakah itu Gemini 3.6 Flash?
Gemini 3.6 Flash ialah model Gemini Google yang berkos lebih rendah, direka untuk beban kerja API berisipadu tinggi, termasuk ejen pengekodan, pemprosesan dokumen, dan aliran kerja automatik.
Apakah kegunaan Gemini 3.6 Flash?
Gemini 3.6 Flash direka untuk ejen pengekodan, pemprosesan dokumen, aliran kerja automatik, dan aplikasi AI berisipadu tinggi lain yang memerlukan kependaman lebih rendah dan kos API yang boleh diramal.
Adakah Gemini 3.6 Flash tersedia sekarang?
Ya, Gemini 3.6 Flash tersedia melalui platform pembangun Google, termasuk Google AI Studio, Android Studio, dan Vertex AI.
Adakah Gemini 3.6 Flash percuma?
Gemini 3.6 Flash tersedia melalui platform pembangun Google, namun penggunaan API mengikut harga berasaskan token bergantung kepada penggunaan input dan output.
Apakah harga API Gemini 3.6 Flash?
Harga API Gemini 3.6 Flash dilaporkan pada $1.50 bagi setiap sejuta token input dan $7.50 bagi setiap sejuta token output. Struktur harga ini direka untuk beban kerja API berisipadu tinggi di mana kecekapan token dan kapasiti adalah kritikal.
Gemini 3.6 Flash lwn Gemini Pro: Apakah perbezaannya?
Gemini 3.6 Flash dioptimumkan untuk beban kerja berisipadu tinggi dan berkos rendah, sementara Gemini Pro menyasarkan tugasan penaakulan yang lebih kompleks di mana keupayaan diutamakan berbanding kelajuan dan harga.
Mengapa Google melancarkan Flash sebelum Pro?
Google mengutamakan model Flash untuk memenuhi permintaan pembangun bagi pelaksanaan API berkapasiti tinggi dan berkependaman rendah dalam persekitaran pengeluaran, sementara Gemini Pro masih belum mencapai ketersediaan awam secara meluas.

Perkara Utama untuk Pasukan Kejuruteraan

Gemini 3.6 Flash meletakkan keluarga Flash Google sebagai pilihan berkos lebih rendah untuk pembangun yang membina aplikasi AI pengeluaran, sementara Gemini Pro kekal tertumpu pada senario penaakulan berkeupayaan lebih tinggi. Pelancaran ini menunjukkan keluarga Flash Google menyasarkan penggunaan AI skala pengeluaran, di mana kecekapan kos dan kebolehpercayaan menjadi sama penting dengan keupayaan model mentah. Bagi pembangun, keputusan utama bukan lagi keupayaan model semata-mata, tetapi sama ada sesebuah model dapat memberikan prestasi yang boleh dipercayai pada skala pengeluaran dan kos yang boleh diramal.

Share this article