2026年7月21日 星期二

當 Google 決定把 AI「焊死」在晶片裡:Frozen v2 不是比較聰明,而是懶得一直跑回家拿答案! #Alphabet #GoogleAI #FrozenV2 #GeminiAI #TPU #AI晶片 #人工智慧 #半導體 #AI推論 #資料中心 #GoogleCloud #AI革命 #科技新知 #科技趨勢 #投資理財 #是德是瑞是克

 



以前大家都覺得 AI 越來越像人類,現在 Google 看起來卻決定讓 AI 更像一位經驗老道的老師傅。

因為老師傅根本不用每次都翻教科書。

Google 最近傳出正在研發一款代號 Frozen v2 的全新 AI 晶片,預計最快 2028 年問世。最有趣的是,它不是要取代目前大家熟悉的 TPU,而是乾脆把 Gemini 的部分能力直接「刻」進晶片裡。

簡單說,就是把 AI 常用的知識直接焊死在硬體。

這聽起來很瘋狂,但其實非常合理。


AI 最大的敵人,其實不是算力,而是「一直搬東西」

很多人以為 AI 回答問題,就是 GPU 或 TPU 拼命算。

其實真正浪費時間的是:

一直讀資料。

可以把現在的大型 AI 想像成一位教授。

有人問:

「台積電毛利率是多少?」

教授並不是馬上回答。

而是:

先翻書→找筆記→查資料→整理→回答。

每回答一次,都要重複這些流程。

真正花時間的不一定是思考,而是不停搬資料。

而大型 AI 也是如此。

現在 Gemini 每回答一句話,都需要:

  • 從 HBM 抓資料
  • 經過 TPU 運算
  • Layer 一層層推論
  • Token 一個一個生成

每一次都要跑完整流程。

所以現在 AI 資料中心最忙的,其實不是運算核心,而是:

Memory Bandwidth(記憶體頻寬)。

資料搬來搬去,比真正計算還耗電。


TPU 是萬能工具

Google 的 TPU(Tensor Processing Unit)其實很像:

瑞士刀。

什麼都能做。

可以:

  • 訓練 Gemini
  • 訓練 Imagen
  • 訓練 AlphaFold
  • 跑翻譯
  • 搜尋排序
  • 推薦演算法

用途非常廣。

因此 TPU 必須保持高度彈性。

任何模型更新,都能重新部署。

今天 Gemini 3。

明天 Gemini 4。

後天 Gemini Ultra。

TPU 都可以跑。


Frozen v2 則比較像電鍋

Frozen v2 完全不同。

它比較像:

「專門煮白飯的電子鍋。」

它不能炒菜。

不能炸雞。

不能烤蛋糕。

但是煮白飯速度超快。

因為它就是為了這件事設計。

Google 這次做法,就是把 Gemini 常用的模型架構,直接固定在晶片裡。

英文叫做:

Embed into Silicon。

意思不是存在 SSD。

也不是存在 HBM。

而是直接變成硬體的一部分。

就像 CPU 裡面的快取(Cache)。

不用每次都重新讀。


為什麼叫 Frozen?

Frozen 的意思不是冰雪奇緣。

而是:

固定(Freeze)

AI 有很多層神經網路。

其中有一些層,其實多年都不太會改。

例如:

  • Token Encoding
  • Embedding
  • Attention 部分流程
  • 常見推論路徑

Google 就想到:

既然幾乎不改,

為什麼還每次都重新算?

乾脆直接做成硬體。

就像以前:

以前播放 MP3。

CPU 要自己解碼。

後來大家乾脆做:

MP3 Decoder。

直接硬體完成。

效率暴增。

Frozen v2 就有點像 AI 世界的硬體解碼器。


為什麼速度可以快 6~10 倍?

根據報導,Google 工程師估計:

Frozen v2 每瓦可處理 Token 數可比 TPU 提高 6~10 倍

原因其實不神祕。

主要來自三件事情。

第一:不用一直搬資料

大型 AI 最耗電的是:

Memory Access。

如果模型直接就在晶片裡。

很多資料根本不用讀。

自然快很多。


第二:少了很多通用設計

TPU 必須支援:

各種模型。

所以很多電路平常根本沒用。

Frozen v2 不需要。

它只服務 Gemini。

很多功能可以直接刪掉。

面積變小。

效率變高。


第三:資料流更短

現在推論流程可能像:

HBM → TPU → Cache → Matrix Engine → Output

Frozen v2 則可能變成:

晶片內部直接完成。

少掉很多中間步驟。

延遲自然下降。


為什麼 Google 不直接全部換成 Frozen?

答案很簡單。

因為 AI 一直在進化。

如果今天把 Gemini 直接刻進晶片。

一年後:

Gemini 6 出來。

怎麼辦?

總不能全部晶片重做。

所以 Google 採用:

雙路線。

TPU:

負責萬用。

Frozen:

負責大量固定工作。

兩者一起合作。


哪些 AI 最需要 Frozen?

不是每種 AI 都需要。

真正需要的是:

每天回答幾十億次、內容高度重複的服務。

例如:

  • Gemini Chat
  • Google Search AI Overview
  • Gmail 智慧回信
  • Google Assistant
  • Workspace AI
  • YouTube AI 摘要
  • Android AI 助理

這些每天都在回答類似問題。

效率提升一點點。

一年就能省下數十億美元的電費。


需求量會很大嗎?

如果 Google 的方向成功,答案很可能是:

非常大。

原因不是因為 AI 更多。

而是因為:

AI 正在進入「推論時代」。

前幾年大家拼的是:

Training(訓練)。

誰 GPU 多。

誰模型大。

現在開始比的是:

Inference(推論)。

因為真正花錢的是:

每天全球幾十億人一直問 AI。

假設 Gemini 一天有 20 億次查詢。

每次省 30% 電。

一年就是天文數字。

Google 最在乎的不是晶片成本。

而是:

資料中心電費。

目前 AI 資料中心最大的成本已逐漸從「買 GPU」延伸到「供電、散熱與營運」,因此只要能提升每瓦效能,就能降低整體營運成本,還能在相同電力下服務更多使用者。


未來不只是 Google

如果 Frozen v2 成功,我相信不只 Google。

未來可能看到:

  • NVIDIA 推出專用推論 ASIC
  • Meta 客製化 Llama Inference Chip
  • Microsoft Azure AI Accelerator
  • Amazon Trainium 與 Inferentia 持續分工演進

甚至每一家大型 AI 公司,都會擁有兩條產品線:

一條負責「學習」,另一條負責「回答」。

就像人類一樣,學生需要天天讀書,但畢業後的老師傅,很多經驗早已內化,不需要每次都翻課本。


結語:AI 的下一場戰爭,不再只是比誰更聰明,而是比誰更省電

過去十年,AI 晶片競賽比的是誰的算力更強、模型更大;未來十年,真正的關鍵可能變成「誰能用更少的電,在更短的時間回答更多問題」。

Frozen v2 的出現,代表 Google 正試圖把部分 AI 能力從「軟體」變成「硬體」,讓常用的推論流程像手機裡的相機晶片、影片解碼器一樣,交給專門電路完成。

因此,Frozen v2 並不是 TPU 的接班人,而是 TPU 的最佳搭檔:TPU 繼續負責訓練與通用運算,Frozen v2 則專攻大量、高頻率的 AI 推論工作。

當 AI 每天要回答數十億次問題時,真正決定勝負的,或許不是誰的模型參數最多,而是**誰能讓每一度電,創造更多的 Token。**這場 AI 軍備競賽,也正式從「算力時代」,邁向「能效時代」。

沒有留言:

張貼留言

當 CoreWeave 的 GPU 開始「吃到撐」:營收暴增 24%,資本支出卻像開了氮氣加速器! #CoreWeave #AI #GPU #AI資料中心 #AI算力 #人工智慧 #AI基礎建設 #雲端運算 #科技股 #美股 #AI投資 #資本支出 #半導體 #NVIDIA #投資理財 #是德是瑞是克

  如果你以為 AI 產業的成長,就是大家買幾張 GPU、開幾台伺服器,那 CoreWeave 第二季財報可能會讓你重新認識「AI 到底有多燒錢」。 CoreWeave(NASDAQ:CRWV)在 2026 年第二季交出一份相當有戲的成績單:營收創新高、AI 雲端需求持續爆發,營...