AI 巨頭觀察室 W6

Gemini 3.5 Pro 推不出來,3.6、3.7、3.8 Flash 卻六週三連發:Google 在玩什麼把戲?

發布日期:2026-09-03 ・ KumoAlpha AI 巨頭觀察室

如果只看版本號,Google 最近的 Gemini Flash 節奏很像在開外掛:3.6 Flash 在 7 月 21 日推出,3.7 Flash 在 8 月 13 日推出,3.8 Flash 則在 9 月 2 日推出。六週內三次發布;後兩次各相隔三週。

但真正該問的不是「3.8 比 3.7 又多幾分」,而是:模型公司是否已把 AI 放進研發自己的迴路?

Google 對 Gemini 3.8 Flash 的說法值得特別注意:3.8 與 3.8 Flash Cyber 的共同底層能力,受到「長時間運行的 agentic loops」加速,這些迴路被設計為遞迴地評估與精煉底層模型。這是少見、而且非常具體的官方表述。

我的判斷很直接:

這不是「AI 已經能自行爆炸式進化」的證據;但它是 RSI(Recursive Self-Improvement,遞迴自我改進)從概念,走向受限、可驗證、可部署的 AI 研發工程。

接下來兩年,最先被改寫的未必是聊天機器人,而是模型研發、軟體工程、算力調度與資安防禦的生產函數。


1. 先把事實釘住:Flash 真的加快了,圖表僅作示意

先看可由 Google 官方資料核對的發布節奏:

  • 2025/04/17:Gemini 2.5 Flash 預覽版。Google 將其定位為首個可開關 thinking、可設定 thinking budget 的完整 hybrid reasoning model。
  • 2025/12/17:Gemini 3 Flash。官方公布 GPQA Diamond 90.4%、MMMU Pro 81.2%、SWE-bench Verified 78%。
  • 2026/05/19:Gemini 3.5 Flash。重點轉向長鏈 agentic 與 coding 工作流;官方舉 Terminal-Bench 2.1 76.2%、MCP Atlas 83.6%、CharXiv Reasoning 84.2%。
  • 2026/07/21:Gemini 3.6 Flash。Google 主打更少的輸出 token、較低單位成本與 agent 工作流效率;以 DeepSWE 49% 對 3.5 Flash 的 37%、MLE-Bench 63.9% 對 49.7% 為例。
  • 2026/08/13:Gemini 3.7 Flash。Google 明確指出距 3.6 僅三週,並歸因於開發者回饋與演算法創新。公開例子包括 DeepSWE v1.1 65.3%(3.6 為 49.0%)、FrontierCode 1.1 Main 43.6%(34.4%)。
  • 2026/09/02:Gemini 3.8 Flash。距 3.7 再三週,且 Google 直接稱這是六週內第三次 Flash 發布;官方則以 HLE-Verified 54.9% 等指標描述其多步推理與 agent 任務能力。

這條時間線足以支持「Flash 的對外更新節奏明顯加速」。以下圖表由作者製作,呈現版本與五項評測的示意趨勢;它不是跨代能力的可比性證據。

Gemini Flash 版本與五項評測的示意趨勢圖
Gemini Flash 版本與五項評測的示意趨勢圖;圖表由作者製作。不同 benchmark、版本與評測設定未必可直接橫向比較,本文的事實依據仍以文末 Google/DeepMind 一手來源為準。

圖表將 2.5 到 3.8 的 Code、MATH、MMLU、GPQA、MMMU 畫成連續曲線,並標上 3.8 的 Code 96.2%、MATH 92.8%、MMLU 92.6%、GPQA 87.4%、MMMU 86.9%。

這些數字不能直接當成本文的事實證據。 原因很簡單:圖表沒有可對照的來源、評測版本、提示設定、是否允許工具、採樣方式或模型 card;而 Google 各代公開的 benchmark 也已改用不同的評測組合,例如 SWE-bench、DeepSWE、Terminal-Bench、HLE-Verified、OSWorld 與長 context 任務。把不同版本的不同評測直接連成「能力成長曲線」,視覺上好懂,方法上卻不成立。

這不是吹毛求疵。當模型進步開始以週為單位發生,可重現的評測與版本可比性,反而比漂亮的折線圖更重要。


2. Google 所說的 RSI,到底是什麼?

RSI 的字面很容易讓人聯想到一顆模型重寫自己的權重、每一輪都變得更聰明、最後進入無法控制的爆炸。現實中的工程版本沒那麼玄,也更有用。

一個可操作的 RSI 迴路,至少有四個元件:

  1. 提出改動:模型或 agent 生成程式、訓練配方、資料處理、提示/harness 或系統設計的候選方案。
  2. 可靠評估:用單元測試、形式驗證、benchmark、模擬器、成本與安全門檻,判斷改動是否真的更好。
  3. 選擇與累積:保留通過門檻的版本、淘汰失敗版本,讓下一輪以較好的候選作為起點。
  4. 受控部署:人類決定目標、資源、風險邊界與是否上線;不是讓 agent 自行更換價值函數或任意動用算力。

這裡的關鍵字不是「自我」,而是可驗證。

2003 年,Jürgen Schmidhuber 提出的 Gödel machine,已將「系統證明某次自我修改有益後再修改」寫成理論模型。它很優雅,但幾乎無法在現實軟體與大模型上替每次改動做全域數學證明。

後來真正推動進展的是把「證明」換成較窄但可執行的驗證:

  • self-play:AlphaGo/AlphaGo Zero 在封閉規則與明確勝負訊號下,能讓系統從自己對弈中學習;
  • AutoML 與演化搜尋:在明確 search space 裡,讓系統探索架構、超參數、資料增強或演算法;
  • LLM + verifier:模型提出程式或解法,再由執行結果、測試、模擬器或獨立 evaluator 打分。

這也解釋了為什麼當代 RSI 最先落在程式、演算法、晶片與系統優化,而不是「讓模型自由思考後自行升級」:這些領域有機器可判定、可量化、可回歸的回饋訊號。


3. AlphaEvolve 是最接近的 Google 證據:不是神祕黑箱,是 evaluator 驅動的演化

若要找 Google 已公開、可看見工作方式的案例,AlphaEvolve 比抽象口號更有說服力。

Google DeepMind 在 2025 年公布 AlphaEvolve:Gemini Flash 擴大候選程式的探索廣度、Gemini Pro 提供更深的建議,然後由 automated evaluators 驗證、執行與打分候選程式;演化框架再保留較好的方案,餵回後續迭代。

這條迴路已進到 Google 的實際基礎設施:

  • 改善資料中心排程,官方稱平均回收 Google 全球 0.7% 的運算資源;
  • 將 Gemini 訓練中一個重要矩陣乘法 kernel 加速 23%,對應約 1% 的訓練時間降低;
  • 把原本需要專家數週的 kernel 最佳化,縮短到數天的自動化實驗;
  • 在晶片設計、快取策略與其他運算基礎設施中提出通過驗證的變更。

這些數字是 Google 的公開說法,不是 KumoAlpha 自測;但它們指出一件很重要的事:AI 幫 AI 研發的最強飛輪,短期不一定先表現在 benchmark 分數,而是先表現在「用相同算力做更多可靠實驗」。

當系統能優化訓練 kernel、排程與硬體設計,節省下來的計算資源可以重新投入資料生成、訓練與評測。這是一個有實體摩擦的正回饋,而不是無成本的指數魔法。

Gemini 3.8 對「長時間 agentic loops」的描述,應放在這個脈絡下理解:更接近 AlphaEvolve 式的候選生成—評估—篩選—再迭代,而不是模型擅自把自己升級到下一代。


4. 為何 Flash 的節奏會先變快?因為它是最佳的迭代載體

Flash 系列不是單純的「便宜版」。它的產品角色很適合成為快速迭代的載體:低延遲、低單位成本、可配置 thinking effort,而且大量進入 API、企業 agent 與 Google 自己的產品面。

這會形成三個加速器。

4.1 真實工作流回饋變密

3.6 的公開說法是直接建立在 developer/customer feedback 上;3.7 更明講,三週後的更新來自回饋與演算法創新。當大量 agent 在真實的 coding、文件、工具呼叫與企業流程裡運行,團隊能更快找到失敗模式:哪裡會多走迴圈、哪裡會做多餘編輯、哪種工具使用最不可靠。

模型公司的資料優勢,不只是多拿到文本;而是得到更多可評估的任務軌跡。

4.2 agent 讓改進不再只發生在權重

一次產品能力升級,可能來自基座權重,也可能來自後訓練、推理時 effort 配置、工具使用、harness、資料處理、安全策略與 evaluator。這些層次並非每次都需要從頭預訓練。

因此,看到「三週一版」不應推論 Google 每三週重訓一顆完整新模型;比較合理的解釋是,模型、後訓練、推理與 agent 系統已變成可以分層升級的組合產品。

4.3 有 verifier 的任務,最能餵出迴路

程式能編譯、測試能通過、benchmark 能打分、資料中心能量測吞吐與成本。這些任務讓模型的候選方案不用全部依賴人類主觀判斷。

所以近期最顯眼的躍升集中在 software engineering、工具使用、長鏈 agent 與資安修補,並不奇怪。可驗證的回饋越硬,迭代閉環越容易跑快。


5. 未來兩年:不是「AI 自我爆炸」,而是四條產業曲線變陡

(1)模型發布將更像持續交付,評測治理會成為採購核心

過去企業一年換一次主模型,還能接受。若能力、價格與安全設定每幾週都變動,模型不再是一次採購,而是持續供應鏈。

企業應把「哪個模型最強」改成四個可回歸問題:

  • 在固定任務集上,品質是否真的提升?
  • 單次任務的 token、工具與人工覆核成本是否下降?
  • 失敗模式是否改變,尤其是幻覺、越權、提示注入與錯誤行動?
  • 版本可否回滾、結果可否稽核?

沒有自有 eval 的公司,會把供應商發表會當作產品 roadmap。那很危險。

(2)軟體工程會先被壓縮的是「驗證良好的雜務」

短期最受影響的不是所有工程師,而是具有測試、規格、lint、CI 與明確驗收的工作:bug triage、重構候選、測試補齊、升級相依套件、文件與 migration。Agent 可連續嘗試多個候選,而 verifier 負責把錯誤攔在部署前。

人的角色會更往上游移:定義規格、設計測試、處理架構取捨、判斷風險與建立能讓 agent 安全操作的邊界。

沒有測試與可觀測性的 legacy code,不會因為模型變強就自動變成自動化金礦;它更可能成為 agent 最昂貴的事故場。

(3)算力競爭從「買更多 GPU」轉向「讓每一輪實驗更有效」

AlphaEvolve 所示範的飛輪很務實:演算法與系統效率改善,釋出訓練/推理資源;資源回投更多實驗;更快找到下一個改善點。

這會推高資料中心排程、編譯器、kernel、TPU/GPU 設計、自動化 benchmark 與實驗管理的戰略價值。未來兩年,真正拉開研發速度差的,不只是哪家公司有多少加速器,更是誰能把算力轉成更多有效且可判定的實驗回合。

不過邊際報酬會遞減:越接近最佳化前緣,候選方案越難驗證、回歸成本越高,硬體與能源也不是軟體能憑空消掉的約束。這條曲線會變陡,但不會無限上翹。

(4)資安成為 RSI 最尖銳、也最需要受限部署的戰場

Google 3.8 Flash Cyber 聚焦找漏洞與自動修補,並只向受信任防禦方透過 Fairwind Program 開放。這個產品策略本身就是訊號:同一套「生成候選—驗證—反覆修正」能力,可讓防守方更快修補,也可能降低攻擊者研究與迭代的門檻。

未來兩年,安全團隊要面對的不是單一聊天模型,而是能長時間跑任務、會使用工具、會從錯誤中調整下一步的 agent。防線必須同步升級:最小權限、隔離 sandbox、工具 allowlist、異常偵測、人工核准點,以及可重放的完整 audit log。

能自我修正的 agent,不代表可以自行授權。


6. RSI 的真正瓶頸:不是生成能力,而是判斷「什麼叫更好」

RSI 最常被講成生成問題:「模型能不能寫出更好的程式?」其實更難的是評估問題:「你如何知道這個改動真的更好,而且沒有在看不到的地方變壞?」

這是為什麼:

  • benchmark 被刷高,不等於真實任務更可靠;
  • 讓同一模型產生、打分、選擇,容易變成自我確認迴路;
  • 只優化容易量測的指標,可能犧牲安全、泛化、成本或人類偏好;
  • 訓練資料、評測資料與 agent 軌跡若缺乏多樣性與外部驗證,會有回饋偏差與模型崩塌風險。

Google 3.8 的 model card 也提醒,部分安全評測在新版本下改善評測方法,因此不必然能與舊結果直接比較;它並揭露多語安全上較 3.7 略有退步。這比任何全線上升的圖更接近現實:能力不是一條乾淨的直線,安全、成本、延遲與不同語言/任務間都有交換。

成熟的 RSI 不是把人移出迴路;而是把人從逐行嘗試,移到定義目標、設計 evaluator、監督資源與批准部署的位置。


結論:Google 的領先訊號,不是 3.8 這個版本號,而是「研發迴路變短」

Gemini Flash 的六週三連發,已足以說明 Google 能把模型與 agent 能力的更新節奏壓到週級;而 3.8 對遞迴評估與精煉迴路的官方說法,則讓 RSI 不再只是旁觀者的猜測。

但我們不該把這件事神化為 AI 即將無限自我升級。

目前真正發生的是更具體、也更具商業殺傷力的版本:

模型提出候選,verifier 決定去留,agent 把實驗跑得更久、更廣;人類仍掌握目標、權限、算力與上線閘門。

未來兩年,競爭力不只在於擁有最聰明的模型,而在於誰能建立最快、最可靠、最安全的「候選—評測—回歸—部署」迴路。

對使用 AI 的企業也是同一件事:不要追著每個新版本跑。先把能驗證的任務、權限邊界、回歸題組與可回滾流程建起來。沒有這些,快速迭代只會讓你更快地把錯誤自動化。


來源與資料界線

一手來源:Google/Google DeepMind

技術背景

本文所有 Gemini 發布日期、產品說法與 benchmark 數字,均以 Google/Google DeepMind 一手資料為準。本文所附圖表由作者製作,作為版本與評測示意;因不同 benchmark、版本與評測設定未必可直接橫向比較,未將其 2.5–3.8 跨代折線與終點分數作為事實依據。

本文為技術與產業觀察,不構成任何投資建議、證券買賣建議、法律意見或績效承諾。

本內容僅供資訊整理與產業觀察,不構成任何投資建議、法律意見或勸誘。詳見 法律免責聲明。

想在第一時間看到新的觀察?

加股蝦 LINE 好友,直接在聊天室查台股公開資料、問研究報告。
也歡迎試用 股蝦 與 爪爪。

加 LINE 開始使用
產品 Prevoca — 簡報講稿與示範語音 股蝦 — 台股 AI 助理 爪爪 — 生活小助手 企業合作 研究 研究報告庫 AI 巨頭觀察室 公司 關於我們 公司資訊 免責聲明 隱私權 聯繫我們