把光引擎焊進晶片旁邊:輝達 Spectrum-X 全面投產,矽光子從論文走進機房
8月14日,輝達的 AI 基礎設施官方帳號 @NVIDIAAIInfra 在 X 平臺發出一則宣布:Spectrum-X 乙太網路光子交換器進入全面投產,成為全球首款量產的 200G/lane 共封裝光學(CPO)乙太網路交換器系統(來源:官方公告)。隔天,消息經 IT之家 等科技媒體轉載,加上鴻海 CPO 機櫃出貨傳聞、輝達與康寧在美設廠研發 CPO 等報導接連見報,「矽光子」三個字再度被推到技術圈的目光中央(來源:公開報導)。
「200G/lane」先拆字:lane 指通道,這個數字表示每條實體通道每秒可傳 200 Gigabit 的資料。CPO(Co-Packaged Optics,共封裝光學)講的則是一件更根本的事:把光,直接裝到晶片旁邊。這些名詞任何一個單獨出現都足夠勸退一般人,先給一個粗略定位:如果 AI 資料中心是一座城市,這臺機器就是城裡的交流道與主幹道,而這次工程隊動的,是道路的材質。
疑問一:CPO 到底把什麼東西,裝到了哪裡?
傳統資料中心的網路長這樣:交換器面板上插滿一支支可插拔光模組,電訊號先轉成光、走光纖抵達對岸、再轉回電訊號。這套作法行之有年,代價是每次轉換都要喫功耗、生熱,面板上還多出一個可能故障的節點。
Spectrum-X 的作法是把光學引擎與交換晶片封進同一個模組。系統核心是一塊多晶片模組(MCM),內部平行整合數百個矽光子引擎,每個引擎處理多條高速通道,把交換晶片輸出的電訊號轉為光。光訊號的生成與轉換貼著交換晶片進行,電訊號要跑的路徑大幅縮短(來源:輝達官方說明)。
雷射的位置也被重新安排。傳統方案裡,每個收發器各自內建雷射器;新架構改由外置雷射源統一向多個光學引擎供光,所需雷射器數量只剩原方案的四分之一。用居家比喻,這像是從「每個房間各裝一臺熱水器」改成「整棟樓共用一套中央系統」:設備變少,熱源與故障點跟著變少。
疑問二:規格有多大?一秒搬完一千部電影是什麼概念
兩款型號撐起這次投產。SN6810 在 2U 液冷機箱內提供 128 個 800Gb/s 埠,總交換容量 102.4 Tb/s;更大的 SN6800 用 5U 機箱堆疊四顆交換晶片,容量來到 409.6 Tb/s,可接 512 個 800Gb/s 埠,或超過 2,000 個 200Gb/s 埠(來源:輝達官方規格)。
409.6 Tb/s 換算下來是每秒約 51.2TB。以一部高畫質電影動輒數十GB 計,SN6800 一秒吞吐的量,大致等於一千部電影同時裝箱搬走。一般人家裡的寬頻永遠用不到這個數字,但大型 AI 訓練進行時,成千上萬顆 GPU 互相搬運參數與中間結果,喫的正是這種等級的頻寬。
疑問三:為什麼是現在?AI 工廠把網路逼上前線
輝達對應用場景的描述很直接:大規模 AI 訓練與推論叢集。當資料中心朝「AI 工廠」演進,塞滿 GPU 的伺服器必須在高頻寬下頻繁交換資料,網路從配角變成主角;可插拔光模組的功耗與故障率,在幾萬顆 GPU 的規模下會被放大成實實在在的成本(來源:官方公告)。
把時間軸拉長,這則新聞還有一層脈絡。1966 年,後來被稱為「光纖通訊之父」的高錕發表論文,提出以玻璃纖維傳遞光訊號的可行性,並在 2009 年獲得諾貝爾物理學獎。光纖先鋪進海底電纜,再鋪進機房與家戶,如今被要求再往前一步,坐進交換晶片的封裝裡。半世紀前的題目是「光能走多遠」,現在的題目換成「光跟電的距離能不能再短一點」。
零組件從產業版面走進大眾視野的劇情也不陌生。先前閃迪單日大漲近 14% 那一週,藏在手機裡的記憶體曾被留言板翻出來逐條討論;這一回,輪到光通訊上桌。
疑問四:這臺機器的片尾名單,記了哪些名字?
一臺 CPO 交換器很難由單一公司完成,這次的分工名單像極了電影片尾的工作人員表:臺積電負責矽光子技術,矽品(SPIL)負責晶片級封裝與測試,Lumentum 與 TFC 供應雷射組件,鴻海負責整機交換器系統開發,輝達則在自家設施完成出貨前的最終測試(來源:公開報導)。
製程上同樣有講究:光學引擎直接焊接到模組基板,頂部以光纖連接器高精度對位。輝達強調這套作法可納入常規量產流程,這也是「全面投產」四個字能說出口的原因。
疑問五:跟一般人的距離,到底有多遠?
先說答案:這臺機器不會出現在客廳,家裡的寬頻速率短期內與它無關,它的買家是蓋 AI 工廠的雲端業者。不過每天碰得到的服務,聊天機器人、串流推薦、雲端遊戲,背後都是資料中心裡的伺服器在互相搬資料;模型規模繼續膨脹,這類搬運工程就會繼續升級。輝達同一時間也把算力往消費端鋪,先前才把GeForce NOW 帶上 Linux 原生應用,玩家按下滑鼠的那一端,連的正是這種日夜吞吐的機房。
省電是另一條主線。輝達宣稱,與採用傳統可插拔光模組的網路相比,新系統功耗降至五分之一,AI 應用無中斷運行時間延長五倍,平均事件間隔時間提高十倍(來源:輝達官方說法)。這些是廠商給出的數字,實際表現還要等更多第三方案例檢驗,但方向足夠清楚:當電力成為 AI 資料中心最現實的約束,省下來的每一瓦都是籌碼。
從高錕那篇論文到 Spectrum-X 的產線,光走了六十年,才從海底一路坐進晶片封裝裡。下一次你按下送出、等 AI 回話的那一兩秒,資料可能正穿過某個 5U 機箱裡的數百個光引擎。「矽光子時代來了嗎?」至少在量產這件事上,機器已經開機。下一個懸念是,銅線與可插拔模組的退場,會以什麼樣的節奏上演。