30 秒看重點
- 事件:台灣人葉威延創立的 GMI Cloud 專攻 AI 推理雲端,獲 NVIDIA 認證與黃仁勳青睞。
- 意義:AI 市場重心從「模型訓練」轉向「應用推理」,平價高效的推理算力成為新戰場。
- 影響:台灣新創成功打入全球 AI 算力供應鏈,為台灣企業提供更靈活的 GPU 部署選擇。
台灣囡仔在矽谷發光!由葉威延創辦的 GMI Cloud 憑藉獨特的「AI 推理」雲端定位,成功獲得 NVIDIA 官方認證。隨著 AI 應用大爆發,市場對算力的需求已從昂貴的「訓練」轉向日常的「推理」,GMI Cloud 提供彈性且平價的 GPU 算力,成為企業降低 AI 部署成本的最佳橋樑。
為什麼黃仁勳也找上門?拆解 AI 推理雲端的新商機
AI 發展已經走過「把模型練大」的軍備競賽階段,現在各大企業最頭痛的問題,是如何讓這些模型「便宜又快速地運作」。這就是所謂的「AI 推理(Inference)」。過去兩年,全球科技巨頭瘋搶 NVIDIA H100 晶片來進行 AI 訓練,但當模型訓練完成、要上線服務百萬用戶時,繼續使用昂貴的 H100 就顯得大材小用且成本過高。GMI Cloud 執行長葉威延敏銳地察覺到這個痛點,決定不與微軟、亞馬遜等雲端巨頭硬碰硬,而是專注於提供適合「推理」的彈性 GPU 算力服務。
GMI Cloud 的核心優勢在於「軟硬整合」與「極致的性價比」。他們不僅僅是租售 GPU,而是透過自主研發的調度軟體,將 NVIDIA L40S 等適合推理的晶片效能發揮到極致,提供低延遲、高吞吐量的「裸金屬(Bare Metal)雲端服務」。這種「需要多少、租多少」的彈性模式,直接擊中中小型企業與新創公司的痛點,這也是為什麼 NVIDIA 執行長黃仁勳會親自關注並給予官方合作夥伴認證。對 NVIDIA 來說,像 GMI Cloud 這樣靈活的雲端服務商(MSP),能協助將 NVIDIA 的晶片生態系滲透到更多中小型應用場景中。
- 2023-11,GMI Cloud 正式成立,定位為次世代 GPU 雲端服務商,專注解決 AI 算力瓶頸。
- 2024-Q3,獲得 NVIDIA 官方雲端夥伴(NCP)認證,強攻 AI 推理市場,並積極與台灣硬體供應鏈對接。
台灣怎麼看這件事?
這件事對台灣科技產業具有兩大指標性意義。首先,這證明了台灣人在 AI 浪潮中,不只能做「硬體代工」,更有能力在全球「雲端軟體與算力調度」服務中佔有一席之地。GMI Cloud 的伺服器與硬體設備高度依賴台灣供應鏈(如華碩、技嘉等),這種「台美聯軍」的模式,能幫台灣硬體廠開拓新的出海口。其次,對於正想導入 AI 的台灣中小型企業而言,這類平價的推理雲端服務,能大幅降低數位轉型的門檻,避免在即將到來的 AI 淘汰賽中因為資金不足而被邊緣化。
編輯觀點
AI 產業正在經歷一場從「炒作期」走向「實用期」的洗牌。當市場開始高喊「AI 股進入淘汰賽」,就代表那些只會講故事、沒有實質營收的企業將被淘汰,而像 GMI Cloud 這種能切實幫企業「省錢、提高 AI 運作效率」的基礎設施服務,反而會迎來爆發期。避開紅海、深耕利基市場,正是台灣新創在 AI 時代最值得借鏡的生存法則。
常見問題
- 什麼是 AI 推理(AI Inference)?
- AI 推理是指將已經訓練好的 AI 模型,拿來實際回答問題或執行任務。例如:ChatGPT 根據你的問題寫出一篇文章,這個「回答」的過程就是推理。
- GMI Cloud 與微軟、亞馬遜等雲端巨頭有何不同?
- 微軟和亞馬遜主打全方位的雲端服務,價格較高且合約較僵硬;GMI Cloud 則專注於「GPU 算力」,提供極速部署、低延遲且價格更親民的裸金屬雲端服務。
- 為什麼黃仁勳會支持 GMI Cloud?
- 因為 NVIDIA 需要多樣化的管道來銷售其不同定位的 GPU。GMI Cloud 能幫助 NVIDIA 的推理晶片(如 L40S)快速滲透到中小型企業市場,擴大 NVIDIA 的生態系影響力。
- 企業為什麼不自己買 GPU,而要用 GMI Cloud 的服務?
- 自建 GPU 機房需要極高的一次性硬體採購成本、電力與散熱維護成本。使用雲端算力可以「隨租隨用」,大幅降低資金壓力與維護麻煩。
- AI 推理市場未來的商機有多大?
- 隨著越來越多 AI 應用(如 AI 客服、自動生成影像、智慧合約)落地,市場預估未來 AI 推理的算力需求將超越 AI 訓練,成為 GPU 市場的最大餅。
名詞小教室
- AI 推理 (Inference)
- 就像學生「上場考試」。模型訓練是寒窗苦讀,推理則是把讀進去的知識拿來回答考卷,需要的是快速、精準且低成本的反應。 裸金屬雲端 (Bare Metal Cloud)
- 就像租一整棟「無裝潢獨棟別墅」,租戶可以完全掌控整台伺服器的硬體效能,不會像傳統虛擬主機一樣與他人共享資源,速度更快、延遲極低。