首頁 / 放.新聞 / 科技
放.新聞
科技

NVIDIA Groq 3 LPX正式量產!低延遲推論加入Vera Rubin版圖 AI運算走向異質整合

2026.08.25
16:09pm
/ 放言編輯部 李云瑄

 

AI晶片戰場正在從「誰的GPU算得最快」,進一步走向「不同處理器怎麼一起工作」。NVIDIA 8月24日在Hot Chips 2026宣布,專門處理互動式AI推論的Groq 3 LPX已正式進入量產,成為Vera Rubin平台的重要一環。首家宣布採用的AI雲端業者是Nebius,原本的Groq公司也計畫成為早期導入者之一。

 



這裡必須先釐清一件事:NVIDIA並沒有收購Groq公司。 2025年12月,雙方簽署的是非獨家推論技術授權協議,Groq創辦人Jonathan Ross、總裁Sunny Madra及部分團隊成員加入NVIDIA,但Groq仍以獨立公司形式營運,GroqCloud也持續提供服務。NVIDIA年報更明確記載,交易沒有買下Groq股權、既有產品或客戶合約。

 

Groq 3 LPX的角色也與GPU不同。AI模型運作大致可以拆成讀入大量上下文的「prefill」,以及一個接一個產生答案的「decode」。Agentic AI需要不斷思考、呼叫工具、讀檔案、寫程式再檢查結果,推論步驟可能累積到數百甚至數千次,這時候每一個token產生速度就會直接影響使用者感受到的延遲。Groq 3 LPX正是針對這個瓶頸設計,與Vera Rubin NVL72協同工作,而不是單獨取代GPU。

 

NVIDIA表示,在Artificial Analysis以Gemma 4 31B模型、10萬token長上下文進行測試時,Groq 3 LPX達到每秒約3,400個輸出token;NVIDIA並宣稱,在特定Agentic與延遲敏感工作負載下,其回應速度最高可達最接近替代平台的4倍。這些數字仍應視為特定模型與測試環境下的結果,但至少顯示NVIDIA已經不準備只靠GPU處理所有AI工作。

 

更重要的是Vera Rubin的架構方向。NVIDIA現在把不同需求拆到不同處理器與機櫃:GPU處理大規模運算,Vera CPU承擔CPU密集工作,Groq 3 LPX專攻快速token生成,再以BlueField、Spectrum-X及儲存系統串起來。AI資料中心正在從「買一堆GPU」變成高度異質化的AI工廠,未來競爭的不會只有單顆晶片,而是誰能把運算、記憶體、網路、儲存、供電與散熱整合成效率最高的整套系統。

 

 

圖片來源:AI生成、翻攝畫面

 

最新新聞
延伸閱讀
最新新聞