GPU 機櫃託管和一般主機代管最大的差別只有一件事:電力。一台一般的 1U 網站伺服器功耗 150~300W;一台配資料中心等級 GPU 的主機動輒 1.5~3kW,往往一台就吃掉整個機櫃的基本供電配額,散熱與地板承重也跟著超標。所以選 GPU 託管機房,不能用「幾 U 多少錢」的邏輯去問,而要用「每櫃供幾 kW、怎麼散熱、合約能不能隨專案伸縮」去問。這篇整理 7 個確認點,並且老實說:什麼情況你根本不該託管,租雲端 GPU 比較划算。
先判斷:該自購託管,還是租雲端 GPU?
這是花錢前最該回答的問題,判斷依據是使用率和需求的確定性:
| 情境 | 建議 | 理由 |
|---|---|---|
| 每天跑不到 6 小時,或專案性的訓練 | 租雲端 GPU | 按小時計費,閒置時不花錢 |
| 每天穩定跑 8~10 小時以上、持續一年以上 | 自購+託管 | 總持有成本通常 12~18 個月內低於雲端 |
| 推論服務全天在線、對延遲敏感 | 自購+託管 | 固定成本可預測,機房在台灣延遲低 |
| 資料不能出境或有法規要求 | 自購+託管(台灣機房) | 資料主權明確,設備在自己名下 |
| 還不確定模型會不會一直跑 | 先租雲端 | 不綁死資金,確定後再轉託管 |
一個常見的錯誤順序
先買了 GPU 主機、再找地方放。買之前先問機房「這台功耗多少、尺寸多少、放得進去嗎、一年多少錢」,把託管費算進總成本,再決定買不買,才不會買了才發現整個機房沒有一櫃供得起。
確認點 1:每櫃供電上限與備援
這是 GPU 託管最不能妥協的數字。一般機房的標準機櫃供電約 2~4kW,高密度區可到 6~10kW,再往上就需要專門的液冷或特殊配置。問法很直接:
- 每櫃供電上限幾 kW?以 A 計的話是幾 A、幾相?
- 是否雙路市電?UPS 撐多久?發電機多久內接手?
- 超過基本配額怎麼計價?以實際用電量計還是以配額計?
如果對方答不出每櫃 kW 數,代表這個機房沒有處理過高功耗設備,不要放。
確認點 2:散熱方式與熱負載上限
電進去多少、熱就出來多少。風冷機房的每櫃散熱極限通常就是 5~10kW,超過就得靠冷熱通道封閉、行間空調或液冷。要問的是:
- 每櫃可承受的熱負載幾 kW?和供電上限一致嗎?
- 有沒有冷熱通道隔離?進風溫度控制在幾度?
- 設備可以集中放,還是會被要求分散到不同機櫃(多付空間費)?
確認點 3:地板承重與機櫃深度
這一項很少人問,但滿載 GPU 的機櫃重量可能超過一般機房高架地板的設計值;多 GPU 主機的深度也常超過標準機櫃的可用深度。確認:每平方公尺承重幾公斤?機櫃深度多少?導軌是否相容?
確認點 4:頻寬與延遲
訓練工作對頻寬要求不高(資料進去後就在機器裡跑),但推論服務對延遲敏感——使用者在台灣、機器也在台灣,延遲就是幾毫秒;放到海外雲端就是幾十到上百毫秒。要問的是保證頻寬多少、上游電信商是誰、有沒有流量總量上限。這部分的判斷方式和一般代管相同,見中華電信 IDC 機房租用費用怎麼算。
確認點 5:合約彈性
AI 專案的設備需求變化比一般網站快得多:三個月後可能從一台變三台,也可能專案結束整批撤掉。一般主機代管多半是年繳制,GPU 託管如果沒有彈性條款,很容易變成付了整年的電力配額卻只用三個月。確認:
- 能不能按月或按季調整空間與電力配額?
- 擴充時是加簽附約還是整份重新議約?
- 提前終止的違約方式是什麼?
確認點 6:遠端操作與全天維運
GPU 主機當機的成本比網站伺服器高得多——可能是跑了三天的訓練任務歸零。要確認機房有沒有全天值機、遠端重開機是否免費、能不能接 IPMI/BMC 遠端管理、進機房維修的預約方式與時段。「全天維運」要拆開問:是有人在機房,還是只有人接電話?
確認點 7:費用結構要看得懂
一般代管的報價以空間為主、電力附帶;GPU 託管的合理報價應該以電力為主要計價單位,並清楚列出:每 kW 月費或年費、每櫃供電上限、超額計價方式、散熱是否另計、頻寬與 IP 費用。如果一份 GPU 託管報價只寫「幾 U 多少錢」而沒提電力,通常代表對方沒真正評估過你的設備。
七個確認點的快速版
每櫃幾 kW?怎麼散熱、上限幾 kW?地板承重與機櫃深度?保證頻寬多少、延遲多少?合約能不能按季調?有沒有真的全天值機與遠端管理?報價是不是以電力計?——七題裡有任何一題對方答不出數字,就換一家問。
瑪尼國際的做法
我們的標準方案是中華電信光纖機房的 1U/2U 主機代管(1U 年繳 24,000 元、2U 年繳 38,000 元,保證頻寬 300/500 Mbps),適合單張 GPU 的工作站等級設備;多 GPU 的高密度設備需要依電力、散熱與機櫃配置個別評估。把設備型號、數量、功耗與預估使用時數告訴我們,我們會直接說適不適合放進來、或者建議你先用雲端 GPU——不會為了成交把放不下的設備硬塞進去。一般代管的計價邏輯與五年成本比較,見主機代管費用怎麼算。
常見問題
Q:GPU 主機可以放進一般的 1U/2U 主機代管方案嗎?
要看功耗。一般 1U/2U 代管方案的基本電力配額是照 150~300W 的伺服器設計的,一台配單張消費級 GPU 的工作站(400~700W)通常還放得進去,但要先確認電力與散熱;配多張資料中心等級 GPU 的主機(1.5~3kW 以上)多半超過單一 U 位的供電與散熱上限,機房會要求改以獨立機櫃或高密度區計價。所以 GPU 設備託管的第一步不是問「幾 U」,而是先報功耗與尺寸請機房評估。
Q:GPU 機櫃託管的費用怎麼算?
骨架和一般代管一樣是空間、頻寬、電力三項,但比重完全不同:一般代管以空間為主、電力附帶;GPU 託管則以電力(每 kW 或每 A)為主要計價單位,空間反而是次要。合理的報價會清楚寫出每櫃供電上限(例如 6kW、10kW)、超過怎麼算,以及散熱是否另計。如果一份 GPU 託管報價只寫「幾 U 多少錢」而沒提電力,通常代表對方沒真正評估過你的設備。
Q:自己買 GPU 主機拿去託管,和租雲端 GPU,哪個划算?
取決於使用率。雲端 GPU 按小時計費,適合每天只跑幾小時、或專案性的訓練工作;如果 GPU 每天使用超過 8~10 小時、且會持續一年以上,自購設備加託管的總持有成本通常在 12~18 個月內就低於雲端租用。反過來說,還不確定模型會不會一直跑、或需求量起伏很大的階段,先用雲端比較不會綁死資金。
Q:GPU 託管要看哪些機房規格?
最關鍵的五項:每櫃供電上限與備援方式(雙路市電、UPS、發電機);散熱方式與每櫃可承受的熱負載(風冷的機房通常每櫃 5~10kW 就是極限);地板承重(滿載 GPU 機櫃可能超過一般機房設計);對外頻寬與延遲(模型推論服務對延遲敏感);以及是否提供 24 小時值機與遠端操作。這五項有任何一項對方答不出數字,就要小心。
Q:什麼是「彈性合約」?GPU 託管為什麼特別需要?
AI 專案的設備需求變化快:三個月後可能從一台變三台,也可能專案結束整批撤掉。彈性合約指的是可以按月或按季調整機櫃空間與電力配額、不用一次簽三年、擴充時不必重新議約。一般主機代管多半年繳制,GPU 託管如果沒有彈性條款,很容易變成付了整年的電力配額卻只用三個月。
Q:瑪尼國際有提供 GPU 機櫃託管嗎?
我們的標準方案是中華電信光纖機房的 1U/2U 代管,單張 GPU 的工作站等級設備可以先讓我們評估功耗與散熱;多 GPU 的高密度設備則需要依電力、散熱與機櫃配置個別報價。把設備型號、數量、功耗與預估使用時數告訴我們,我們會直接說適不適合放進來、或建議你改用雲端 GPU,不會硬收。
有一台 GPU 主機不知道該放哪?
告訴我們設備型號、功耗與每天使用時數,我們幫你算託管與雲端租用哪個划算,並確認機房放不放得下。
免費評估 →免費諮詢專線 0800-670000 · 技術支援 0921-070-027