以前大家都覺得 AI 越來越像人類,現在 Google 看起來卻決定讓 AI 更像一位經驗老道的老師傅。
因為老師傅根本不用每次都翻教科書。
Google 最近傳出正在研發一款代號 Frozen v2 的全新 AI 晶片,預計最快 2028 年問世。最有趣的是,它不是要取代目前大家熟悉的 TPU,而是乾脆把 Gemini 的部分能力直接「刻」進晶片裡。
簡單說,就是把 AI 常用的知識直接焊死在硬體。
這聽起來很瘋狂,但其實非常合理。
AI 最大的敵人,其實不是算力,而是「一直搬東西」
很多人以為 AI 回答問題,就是 GPU 或 TPU 拼命算。
其實真正浪費時間的是:
一直讀資料。
可以把現在的大型 AI 想像成一位教授。
有人問:
「台積電毛利率是多少?」
教授並不是馬上回答。
而是:
先翻書→找筆記→查資料→整理→回答。
每回答一次,都要重複這些流程。
真正花時間的不一定是思考,而是不停搬資料。
而大型 AI 也是如此。
現在 Gemini 每回答一句話,都需要:
- 從 HBM 抓資料
- 經過 TPU 運算
- Layer 一層層推論
- Token 一個一個生成
每一次都要跑完整流程。
所以現在 AI 資料中心最忙的,其實不是運算核心,而是:
Memory Bandwidth(記憶體頻寬)。
資料搬來搬去,比真正計算還耗電。
TPU 是萬能工具
Google 的 TPU(Tensor Processing Unit)其實很像:
瑞士刀。
什麼都能做。
可以:
- 訓練 Gemini
- 訓練 Imagen
- 訓練 AlphaFold
- 跑翻譯
- 搜尋排序
- 推薦演算法
用途非常廣。
因此 TPU 必須保持高度彈性。
任何模型更新,都能重新部署。
今天 Gemini 3。
明天 Gemini 4。
後天 Gemini Ultra。
TPU 都可以跑。
Frozen v2 則比較像電鍋
Frozen v2 完全不同。
它比較像:
「專門煮白飯的電子鍋。」
它不能炒菜。
不能炸雞。
不能烤蛋糕。
但是煮白飯速度超快。
因為它就是為了這件事設計。
Google 這次做法,就是把 Gemini 常用的模型架構,直接固定在晶片裡。
英文叫做:
Embed into Silicon。
意思不是存在 SSD。
也不是存在 HBM。
而是直接變成硬體的一部分。
就像 CPU 裡面的快取(Cache)。
不用每次都重新讀。
為什麼叫 Frozen?
Frozen 的意思不是冰雪奇緣。
而是:
固定(Freeze)
AI 有很多層神經網路。
其中有一些層,其實多年都不太會改。
例如:
- Token Encoding
- Embedding
- Attention 部分流程
- 常見推論路徑
Google 就想到:
既然幾乎不改,
為什麼還每次都重新算?
乾脆直接做成硬體。
就像以前:
以前播放 MP3。
CPU 要自己解碼。
後來大家乾脆做:
MP3 Decoder。
直接硬體完成。
效率暴增。
Frozen v2 就有點像 AI 世界的硬體解碼器。
為什麼速度可以快 6~10 倍?
根據報導,Google 工程師估計:
Frozen v2 每瓦可處理 Token 數可比 TPU 提高 6~10 倍。
原因其實不神祕。
主要來自三件事情。
第一:不用一直搬資料
大型 AI 最耗電的是:
Memory Access。
如果模型直接就在晶片裡。
很多資料根本不用讀。
自然快很多。
第二:少了很多通用設計
TPU 必須支援:
各種模型。
所以很多電路平常根本沒用。
Frozen v2 不需要。
它只服務 Gemini。
很多功能可以直接刪掉。
面積變小。
效率變高。
第三:資料流更短
現在推論流程可能像:
HBM → TPU → Cache → Matrix Engine → Output
Frozen v2 則可能變成:
晶片內部直接完成。
少掉很多中間步驟。
延遲自然下降。
為什麼 Google 不直接全部換成 Frozen?
答案很簡單。
因為 AI 一直在進化。
如果今天把 Gemini 直接刻進晶片。
一年後:
Gemini 6 出來。
怎麼辦?
總不能全部晶片重做。
所以 Google 採用:
雙路線。
TPU:
負責萬用。
Frozen:
負責大量固定工作。
兩者一起合作。
哪些 AI 最需要 Frozen?
不是每種 AI 都需要。
真正需要的是:
每天回答幾十億次、內容高度重複的服務。
例如:
- Gemini Chat
- Google Search AI Overview
- Gmail 智慧回信
- Google Assistant
- Workspace AI
- YouTube AI 摘要
- Android AI 助理
這些每天都在回答類似問題。
效率提升一點點。
一年就能省下數十億美元的電費。
需求量會很大嗎?
如果 Google 的方向成功,答案很可能是:
非常大。
原因不是因為 AI 更多。
而是因為:
AI 正在進入「推論時代」。
前幾年大家拼的是:
Training(訓練)。
誰 GPU 多。
誰模型大。
現在開始比的是:
Inference(推論)。
因為真正花錢的是:
每天全球幾十億人一直問 AI。
假設 Gemini 一天有 20 億次查詢。
每次省 30% 電。
一年就是天文數字。
Google 最在乎的不是晶片成本。
而是:
資料中心電費。
目前 AI 資料中心最大的成本已逐漸從「買 GPU」延伸到「供電、散熱與營運」,因此只要能提升每瓦效能,就能降低整體營運成本,還能在相同電力下服務更多使用者。
未來不只是 Google
如果 Frozen v2 成功,我相信不只 Google。
未來可能看到:
- NVIDIA 推出專用推論 ASIC
- Meta 客製化 Llama Inference Chip
- Microsoft Azure AI Accelerator
- Amazon Trainium 與 Inferentia 持續分工演進
甚至每一家大型 AI 公司,都會擁有兩條產品線:
一條負責「學習」,另一條負責「回答」。
就像人類一樣,學生需要天天讀書,但畢業後的老師傅,很多經驗早已內化,不需要每次都翻課本。
結語:AI 的下一場戰爭,不再只是比誰更聰明,而是比誰更省電
過去十年,AI 晶片競賽比的是誰的算力更強、模型更大;未來十年,真正的關鍵可能變成「誰能用更少的電,在更短的時間回答更多問題」。
Frozen v2 的出現,代表 Google 正試圖把部分 AI 能力從「軟體」變成「硬體」,讓常用的推論流程像手機裡的相機晶片、影片解碼器一樣,交給專門電路完成。
因此,Frozen v2 並不是 TPU 的接班人,而是 TPU 的最佳搭檔:TPU 繼續負責訓練與通用運算,Frozen v2 則專攻大量、高頻率的 AI 推論工作。
當 AI 每天要回答數十億次問題時,真正決定勝負的,或許不是誰的模型參數最多,而是**誰能讓每一度電,創造更多的 Token。**這場 AI 軍備競賽,也正式從「算力時代」,邁向「能效時代」。

沒有留言:
張貼留言