Gemini 3.5 Flash 全面評測
最後更新:2026-08-12· 14 分鐘閱讀
🚀 快速通道
- ChatGPT 國內版:點擊直達↗
- 穩定鏡像站:開啟鏡像↗
- 官方 ChatGPT:chatgpt.com ↗

更新時間:2026-09-17。若要跟進 Gemini 3.8 Flash,請讀:相對 3.5 的換檔與上手。本頁仍以 3.5 Flash 吞吐與成本評測為主。
導讀
Gemini 3.5 Flash 是 Gemini 3 系列中強調 速度、吞吐與成本效率 的檔位,適合高頻率呼叫、即時輔助與大規模預處理。它不是「廉價版 Ultra」——而是 在可接受品質下把 latency 和帳單壓到最低 的工程選擇。型號參數、免費額度與 API 單價 均以 Google AI 文件 與 定價頁 為準,本文不列出固定價格。
Flash 的核心價值主張
| 維度 | Flash 典型特點 | 對產品的意義 |
|---|---|---|
| 延遲 | 首 token 快、總耗時短 | 聊天、Copilot、表單旁路助手 |
| 成本 | 單位 token 通常低於 Ultra/Pro | 海量摘要、分類、標籤 |
| 吞吐 | 適合並行批次處理 | 離線流水線、夜間 ETL |
| 品質 | 中上,簡單任務夠用 | 難題需 escalation 到 Pro/Ultra |
一句話: Flash 是 預設路由;Ultra 是 上訴法院。
評測方法
- 樣本:500 條真實使用者問句(脫敏),含 40% 簡單 FAQ、30% 摘要、20% 分類、10% 難題。
- 對比對象:同代 Pro、上一代 Flash(若仍可用)、以及人工 baseline。
- 指標:準確率、格式合規率、P95 latency、每千次呼叫成本(按官網帳單核算)。
分項表現
1)簡單問答與 FAQ
表現: Flash 對定義解釋、步驟清單、模板化回覆 一次可用率很高,主觀延遲明顯低於 Ultra。
注意: 事實型 FAQ 仍可能過時;要求模型標註「需核實」或接檢索層。
2)文字摘要與結構化提取
表現: 新聞、郵件執行緒、會議紀要 → 表格(事項 | 負責人 | 日期)類任務,Flash 性價比最佳。
技巧: 固定輸出 schema;超長輸入 先 chunk 再 map-reduce 摘要。
將下列段落壓縮為 3 條 bullet,每條 ≤25 字,不得新增事實。
段落:[文本]
3)分類、打標、路由
表現: 意圖識別、情感粗分、優先級打分、PII 粗篩等 機器學習替代型 任務,Flash 足夠且便宜。
工程模式:
只輸出 JSON:{"intent":"...", "confidence":0.0-1.0}
類別列舉:[列表]
使用者輸入:...
低 confidence 自動轉 Pro/Ultra 或人工。
4)多模態輕量任務
表現: 清晰截圖 OCR 式提取、簡單圖表讀數,Flash 多數可用。
局限: 密集資訊圖、模糊照片 誤讀率上升;此類升 Ultra 或要求人工複核。
5)程式輔助
表現: 單檔案小函式、正則、SQL 簡單查詢、config 片段 生成快。
局限: 跨 repo 重構、複雜並發 bug 建議 Pro/Ultra;Flash 程式 必須跑測試。
Flash 不適合單獨扛的場景
| 場景 | 原因 | 建議 |
|---|---|---|
| 多步數學證明 | 跳步與算錯機率升 | Ultra + 分步 prompt |
| 百萬字級單視窗分析 | 上下文與召回限制 | 分段 + RAG |
| 低解析度掃描合約 | OCR 類錯誤 | 專用 OCR + Ultra 複核 |
| 品牌級長文定稿 | 語氣與邏輯連貫 | Pro/Ultra + 人工潤色 |
API 生產模式:Flash 優先 + 智慧升級
使用者請求 → Flash(預設)
↓ 低 confidence / 使用者點擊「詳細分析」
→ Pro 或 Ultra
實作要點(見 API 指南):
- 環境變數
GEMINI_MODEL_DEFAULT=flash_model_id - 解析 JSON 輸出中的
confidence或規則(長度、關鍵字) - 升級路徑記錄 metrics,防止 全體誤升 Ultra 導致帳單爆炸
- 對 429 限流做佇列與退避
Flash vs Gemini 3 Pro:怎麼選?
| 問題 | 選 Flash | 選 Pro |
|---|---|---|
| QPS > 10 且任務模板化? | ✓ | |
| 需要最強中文長文連貫? | ✓ | |
| MVP 要控 API 帳單? | ✓ | |
| 單次錯誤代價極高? | ✓(或 Ultra) | |
| 延遲 P95 < 2s? | ✓ | 視負載 |
用 同一套評測包 跑 100 條真實輸入,對比「一次可用率 × 單價」而非憑感覺。
與 GPT 快速檔、Claude 輕量檔的橫向位置
橫向對比見 Gemini 3 vs GPT-5 巔峰對決。Flash 類檔位的共同邏輯是 占流量大頭;旗艦負責 5–10% 難題。具體哪家更快更便宜 每季度重測,以兩家 pricing 為準。
6 條 Flash 高性價比範本
1)郵件一鍵摘要
輸出 JSON:{"summary":"","actions":[{"task":"","owner":"","due":""}]}
缺失欄位 null。郵件正文:
---
{text}
---
2)使用者意圖路由
分類到:billing|tech|sales|other,只輸出類別英文小寫。
訊息:{user_message}
3)標題生成(10 選 1)
基於正文生成 10 個中文標題,≤18 字,風格專業,JSON 陣列。
正文:{body}
4)Chunk 摘要(map 階段)
這是長文第 {i}/{n} 段,僅總結本段,≤80 字,保留專有名詞。
段落:{chunk}
5)敏感資訊提醒(非正式 DLP)
掃描文本是否含疑似手機號/郵箱/金鑰模式,輸出 {"hit":bool,"types":[]}
不輸出原文匹配片段。文本:{text}
6)升級觸發器(給 orchestrator)
若問題含「證明」「推導」「合規」「百萬」等詞,或使用者訊息>2000字,
在 JSON 中加 "escalate": true 並簡述原因;否則 false。
問題:{q}
國內開發者提示
- Flash API 呼叫與 Gemini 官網入口 網路問題解耦:可在海外 Cloud 部署。
- 本地調試網頁行為可登入 gemini.google.com 選擇快速模型(名稱以介面為準)。
- 暫無法使用 Google 服務時,ChatGPT 國內版 可練習 模板化 prompt,遷移時保留 orchestrator 邏輯。
常見問題
Gemini 3.5 Flash 和 2.x Flash 差多少?
代際提升主要體現在推理與多模態細節;具體幅度因任務而異。升級時在 shadow 環境 雙跑一週 再切流量。
Flash 能替代 Embeddings 做搜尋嗎?
不能簡單替代。語意搜尋仍應用 embedding 模型 + 向量庫;Flash 適合 query 理解與生成分段。
免費 API 額度夠個人專案嗎?
免費層限制常變,見 定價頁。個人 side project 通常夠試驗;生產需綁帳單並設配額告警。
如何防止 Flash 幻覺污染資料庫?
結構化輸出 + schema 校驗 + 低 confidence 不入庫 + 人工抽檢高風險欄位。
官方資源
下一步閱讀
- Gemini 3.8 Flash:相對 3.5 的 Agent/程式換檔
- Gemini 3 Ultra 完整評測
- Gemini API 申請與開發指南
- 什麼是 Google Gemini?模型家族解析
行動路徑
今天:用「郵件一鍵摘要」範本在 Flash 上跑 10 封脫敏郵件,記錄格式錯誤率。明天:在 API 裡實作 confidence 升級路由 stub。本週:用 100 條真實問句對比 Flash 與 Pro 的「一次可用率 × 成本」,寫入團隊選型文件。
相關內容
Google Gemini 中文使用指南總覽
2026 Gemini 新手地圖:產品矩陣、官網與 API 分工、多模態能力邊界,以及第一次高品質對話的步驟與可複製提示詞。
什麼是 Google Gemini?模型家族解析
2026 深度解析 Gemini 模型家族:Ultra、Pro、Flash 等型號如何定位、怎麼選,以及與 GPT、Claude 的選型思路。
Gemini 中文版註冊與使用教學
2026 手把手教學:Google 帳號註冊、Gemini 中文對話設定、常用功能上手與新手練習任務清單。
Gemini 官網入口與國內使用
2026 權威說明:gemini.google.com 官方入口、網域辨識、國內網路環境與安全可用的替代體驗路徑。