免記憶體、速度快20倍!晶片巨獸 Cerebras 挑戰輝達,台積電成最大贏家

30 秒看重點

  • 事件: Cerebras 推出全新 AI 推論系統,主打將記憶體直接整合進晶片,推論速度比輝達快數倍。
  • 意義: 徹底解決了限制 AI 算力發展的「記憶體牆」瓶頸,顛覆傳統晶片架構。
  • 影響: 台灣代工龍頭台積電的晶圓級整合技術(SoW)將因此迎來龐大的代工需求。

AI 新創獨角獸 Cerebras 推出挑戰輝達霸權的秘密武器!他們透過將所有記憶體直接蓋在超大晶片上的瘋狂設計,解決了資料傳輸塞車的致命問題,讓 AI 講話速度快到像真人在對談,而這場硬體革命的背後,正是由台灣的台積電在撐腰。

關鍵數據: 全新推論速度比 NVIDIA H100 快 20 倍,每秒可生成達 1,800 個 Token(字詞)。

不用外接記憶體,AI 晶片怎麼跑得比輝達還快?

現在的 AI 晶片(如輝達的 H100)之所以會卡住,很多時候不是因為「大腦」運算不夠快,而是因為「書房」太遠了。在傳統架構中,計算單元與 HBM(高頻寬記憶體)是分開的,AI 每運算一個步驟,就得透過一條狹窄的通道跑去記憶體拿資料,這種傳輸速度的限制在科技界被稱為「記憶體牆」(Memory Wall)。Cerebras 的做法非常暴力且聰明:他們不蓋書房,而是直接把整張晶圓做成一顆「巨無霸晶片」(WSE-3),並將 44GB 的超高速 SRAM(靜態隨機存取記憶體)直接鋪在晶片內部。這意味著大腦與資料之間實現了「零距離」接觸,資料傳輸頻寬提升了數千倍,AI 推論的延遲感瞬間消失,這無疑為生成式 AI 應用開創了全新局勢。

  1. 2019-08 Cerebras 發表第一代晶圓級引擎 WSE-1,以整片晶圓做單一晶片的狂想震驚半導體界。
  2. 2024-03 發表第三代 WSE-3,採用台積電 5 奈米製程,電晶體數量高達 4 兆個。
  3. 近期 推出基於 WSE-3 的超高速 AI 推論服務,正式向輝達的 Llama-3 推論市場發起正面挑戰。

台灣怎麼看這件事?

台灣半導體供應鏈在這場晶片巨獸的對決中,再次站穩了「無可替代」的制高點。Cerebras 這種把整張 12 吋晶圓做成單一晶片的瘋狂設計,不僅良率挑戰極高,更需要極度複雜的散熱與供電技術。這背後如果沒有台積電(TSMC)獨家的「晶圓級整合系統(System-on-Wafer, SoW)」與先進封裝技術支持,根本只是一張無法實現的設計圖。隨著 Cerebras 的高速推論系統在市場上獲得驗證,台積電的先進封裝產能將面臨更供不應求的甜蜜負擔,連帶帶動台灣相關設備與散熱供應鏈的股價與產值。

編輯觀點

Cerebras 的突破證明了一件事:硬體架構的創新,往往比單純追求製程微縮更能帶來跳躍式的效能提升。雖然 Cerebras 晶片因為體積巨大、價格不斐且難以通用化,短期內無法動搖輝達在 AI 訓練市場的絕對統治力;但在「AI 推論」這個需要即時反應、決定用戶體驗的戰場上,Cerebras 已經敲響了警鐘。這種良性競爭將逼迫輝達、超微(AMD)等巨頭加速跟進架構改革,對於全球 AI 應用普及絕對是天大的好事。

常見問題

Q1:Cerebras 的晶片真的「完全不用」記憶體嗎?
並非完全不用,而是它不使用傳統的「外接」記憶體(如 HBM),而是將超高速的 SRAM 直接製造在晶片內部,實現零距離的資料讀取。
Q2:為什麼以前的晶片不採用這種「大晶片」設計?
因為晶片越大,製造時產生瑕疵導致整顆報廢的機率(良率問題)就越高。Cerebras 克服了容錯設計,並仰賴台積電極致的代工技術才得以成真。
Q3:這款晶片對一般大眾有什麼實質好處?
當 AI 服務商採用這種晶片時,我們在使用 ChatGPT 或語音助理時,AI 的回應速度會變得像真人在對答一樣流暢,完全感覺不到延遲。
Q4:輝達(NVIDIA)會因為這項技術而被擊敗嗎?
短期內不會。輝達強在強大的 CUDA 軟體生態系與通用的 GPU 架構,但 Cerebras 會在特定的「超高速推論」利基市場分食輝達的市佔率。
Q5:台積電在這項技術中扮演什麼角色?
台積電是 Cerebras 的獨家代工廠。Cerebras 晶片是利用台積電的 5 奈米製程,以及先進的晶圓級整合封裝技術(SoW)製造而成。

名詞小教室

記憶體牆 (Memory Wall)
就像高鐵開得極快,但出站的檢票口太少、排隊太長,導致整體旅行時間都被卡在排隊上。AI 運算速度極快,但記憶體傳送資料不夠快,就是記憶體牆。
SRAM (靜態隨機存取記憶體)
晶片腦袋裡的「超高速便利貼」,拿取速度極快,但因為成本高、體積大,通常只能在晶片內放少許容量。