W5 Context 工程篇

模型智商不再是瓶頸:Frontier Context 與 30B Open-weight 工人軍團

發布日期:2026-08-22 ・ KumoAlpha AI 巨頭觀察室

副標:最聰明的模型 alone 不會贏。研究級 AI 的勝點,是誰能把正確 context 以正確成本送到正確模型。


每隔幾週就有新模型登頂公開排行榜,然後有人問:為什麼還要投資搜尋、排序、harness?「模型自己讀完不就好了?」

這個問題在聊天 demo 裡很合理;在研究與財經工作流裡,答案越來越清楚:

瓶頸已不是 raw model IQ,而是 context。 Frontier model 很會推理,但很不會搜;同一模型配上好 harness,答案品質可以明顯上升,任務成本也能壓下來。

這不是「再換一顆神模」的故事,而是架構故事:Frontier 主腦 + Open-weight 工人 + Context harness。產業公開討論(含 AlphaSense 2026 年對 frontier models 與 context 的產品文章)與我們在半導體/AI server 研究的實務觀察,正把同一條線畫得更清楚。


1. 為什麼 frontier model 是 mediocre searcher

把一顆最前線模型接上文件庫或市場資料 MCP,丟進一道多跳研究題,通常會撞上三個失敗模式:

失敗模式表面看起來研究現場真正發生的事
Query generation模型「會提問」真實問題夾雜財報期數換算、同名 ticker、講者指稱、實體類型歧義(公司/來源/產品線)。當網搜問句用,在專業 corpus 裡常常打空或打偏。
Prioritization向量距離「最相近」法說會逐字稿、sell-side 預覽、新聞、10-Q 在 cosine 上可能很近,但分析師眼中的權威性完全不同。模型知道文件類型差異,卻不擅長在檢索當下高效排序。
Stopping模型「會再找找」太早停,會拿過期季報回答「當前」;找不到時又狂撈。訓練偏好用「量」補償低精度:多抓、略讀、再抓,context 被重複與噪音稀釋。

結果是:長而髒的 context 同時傷害品質與成本。模型把 token 花在「找」而不是「想」。

所以「frontier context」不是更大 window 的行銷口號,而是一整套工程能力:

  • 領域索引與實體/時間錨點
  • 權威性、新鮮度、相關性的排序訊號
  • 何時停止、何時加深的 stopping policy
  • 把檢索分數回傳給 planner,而不是只丟一堆 chunks

2. 成本真相:token 單價 ≠ 任務成本

企業採購常看 $/M tokens。研究工作流真正該看的是:

答對一題、可覆核一題,總共燒了多少有效 context 與多少人工返工。

幾條產業公開討論裡反覆出現的觀察(以下具體數字皆出自 AlphaSense 2026 公開文章《Frontier AI Models Need Frontier Context》,非 KumoAlpha 自測):

  • 同一 frontier 模型,用「原始向量 RAG/粗 MCP 檢索」自撈 context,相對於優化 harness + 專業搜尋,每題成本約可到 3 倍;優化後答案偏好也可達約 2:1 量級。
  • token 很便宜、但會狂撈 context 的模型,一題帳單可能比「token 較貴、但精準」的配置更貴。
  • 新模型不一定更好。 若新版更愛 over-fetch,品質與成本可能雙崩;升級是任務決策,不是自動跟風。
  • 在適合的 worker 任務上,open-weight 可逼近部分閉源 worker 檔;文中舉例 Gemma 4-31B 相對 Sonnet 5 可達同級表現、成本可低約一個數量級(文中稱約 40x)——這是該文 benchmark 設定下的公開結果,請勿直接外推為所有任務。

換成工程語言:

  1. 省的是每題有效 context 成本,不是盲目換更大模型。
  2. harness 好的時候,同一模型可以把 token 花在推理,而不是狩獵。
  3. 路由錯誤(難題丟小模型、粗活丟神模)比「模型不夠新」更傷。

3. Open-weight ~30B 的正確位置:工人,不是假主腦

從 Gemma 3 這一代起,約 30B 級 open-weight 已經不是「玩具 demo」。它們在抽取、摘要、初篩、格式轉換、高頻監控上,開始具備可產品化的穩定度;再靠領域微調、工具協議與評測迴路,特定垂直場景可以逼近前言模型的 worker 檔,成本卻低一個檔次。

但位置要講清楚:

角色模型檔該做什麼不該硬做什麼
主腦(Frontier)閉源/最強可用 frontier任務拆解、多跳推理、矛盾仲裁、報告骨架、困難綜合、最終敘事逐頁掃庫、重複摘要、整夜監控
工人(Open-weight ~30B)Gemma 系等可私有部署權重段落抽取、表格結構化、來源初篩、事件監控、草稿摘要、工具呼叫粗活跨季因果總裁、高風險合規定調、無 harness 的開放域亂搜
護城河不是單一模型領域 corpus、檢索/排序 harness、eval、預計算結構資料、人審邊界把護城河誤認成「永遠鎖死一家 API」

一句話:open-weight 不是來「取代 frontier」的,是來組成可擴張工人軍團的。 主腦稀缺、工人可水平擴;成本曲線才壓得住。


4. KumoAlpha 怎麼落地這套架構

我們不做「全家都姓一顆模型」的宗教。產品與研究管線朝這個分工走:

4.1 主腦/工人 routing

  • Frontier 主腦:規劃研究問題、決定要哪些來源類型、做多跳綜合、產出可讀報告骨架與結論邊界。
  • Open-weight 工人 sub-agent:法說會段落抽取、供應鏈關鍵句初篩、新聞事件歸類、表格欄位結構化、重複性監控。
  • 路由原則:難題與最終綜合上行;高頻、可評測、可回滾的粗活下行。省的是有效 context 與人工返工,不是帳面上的「模型更便宜」而已。

4.2 領域 corpus,而不是泛網大雜燴

KumoAlpha 的研究重心在半導體、AI server、關鍵供應鏈。護城河不是再包一層通用聊天,而是:

  • 公開財報、法說、產業鏈文件與研究筆記的可檢索 corpus
  • 實體、產品線、節點關係與時間錨點
  • 來源權威性分級(filing ≠ 社群傳言)

同一句「產能/ASP/lead time」,在不同來源權重不同;沒有這層,再聰明的模型也只是很會編排噪音。

4.3 檢索/排序 harness + eval

沒有 eval 的 agent,只是昂貴的 autocomplete。我們把「找對、找夠、適時停止」當一等公民能力:

  • query 改寫與領域同義/期數規則
  • 權威性 × 新鮮度 × 任務相關性排序
  • stopping:何時夠回答、何時必須加深、何時該回報「找不到」
  • 以固定題組與預先註冊評分尺做回歸,避免「新模型上線=默認更好」

4.4 預計算結構資料

很多使用者問題其實是重複形狀:節點對照、事件時間線、關鍵指標切片。與其每次讓模型現場狂撈,不如把高頻問題預先結構化:

  • 預計算摘要與關係表
  • 可版本化的中間產物
  • 主腦只在需要時觸發深挖

這才是研究級系統的工業感:不是每次從零聊天,而是累積可複用的中間事實層。


5. 對企業/研究團隊的實操結論

如果你們正在評估「再買更大模型」或「全面改 open-weight」,建議先回答這五題:

  1. 瓶頸是推理還是 context? 若答案常錯在來源過期、權威錯置、漏關鍵文件,先修 harness,不要先換神模。
  2. 你的單位成本是 token 還是每題? 會 over-fetch 的便宜模型,可能比精準配置更貴。
  3. 任務有沒有分級? 抽取/監控/初篩應下放到 ~30B worker;規劃與困難綜合留給 frontier。
  4. 有沒有領域 corpus 與 eval? 沒有這兩樣,agent 只是把不穩定外包給模型供應商。
  5. 升級流程有沒有回歸門檻? 新模型要過「品質 × 成本 × 停止行為」三關,而不是看發表會。

對研究團隊更直白的落地順序:

  1. 先建可評測題組與來源分級
  2. 再做檢索/排序/stopping harness
  3. 再把粗活切成 open-weight sub-agent
  4. 最後才微調「主腦用哪顆 frontier」

順序反了,你會一直為噪音付費。


6. 我們的立場(寫清楚,避免誤讀)

  • Gemma 3 起,約 30B 開權模型已有一定能力;透過 AI 工程優化(路由、corpus、harness、eval、預計算),在特定領域的 worker 任務上可以逼近前言模型表現,成本顯著較低。
  • 這不是宣稱「小模型全面打敗 frontier」,也不是投資喊單。
  • 真正可複製的優勢,是把「模型智商」從唯一信仰,改成系統智商:誰能穩定供應正確 context。

AlphaSense 那句標題值得借來當產業座標,而不是當轉載全文:

Frontier AI models need frontier context — the smartest model alone won’t win.

對 KumoAlpha 而言,翻譯成產品語言就是:

Frontier 主腦負責想清楚;open-weight 工人負責跑得動;context harness 負責別把錢燒在找錯的東西上。


來源與資料界線

  • 產業觀察參考(非轉載全文):AlphaSense,〈Frontier AI Models Need Frontier Context: Why the Smartest Model Alone Won't Win〉,2026 公開產品文章:https://www.alpha-sense.com/resources/product-articles/frontier-ai-models-context/
  • 文中 3x 成本、約 2:1 偏好、Gemma 4-31B vs Sonnet 5、約 40x 成本差、以及個別模型 over-fetch 等具體數字,皆標註為該文公開 benchmark/論述,不是 KumoAlpha 自有測評結果。
  • KumoAlpha 觀點部分:基於我們在半導體/AI server 研究工作流、agent routing 與產品化過程中的工程判斷,屬架構立場,不是對任何上市公司的評價或買賣建議。

邊界聲明:

本文為產業觀察與工程架構說明,旨在討論研究級 AI 系統如何分工與控成本。未提供任何證券目標價、買賣建議或績效承諾;模型名稱僅作能力分級討論,不代表商業背書或持續領先保證。

本內容僅供資訊整理與產業觀察,不構成投資建議或法律意見。

本內容僅供資訊整理與產業觀察,不構成任何投資建議、法律意見或勸誘。詳見 法律免責聲明。

想把「Frontier 主腦 + 工人軍團」用在真實研究流?

看看 爪爪,或洽詢 企業方案。
也歡迎回到 AI 巨頭觀察室 追蹤模型牌桌與現金流結構。

加 LINE 好友看更多報告
產品 Prevoca — 簡報講稿與示範語音 股蝦 — 台股 AI 助理 爪爪 — 生活小助手 企業合作 研究 研究報告庫 AI 巨頭觀察室 公司 關於我們 公司資訊 免責聲明 隱私權 聯繫我們