[心得] 5卡Local LLM推理機組裝與調整

看板PC_Shopping (個人電腦購買)作者 (laeva75)時間4周前 (2026/08/09 19:15), 3周前編輯推噓89(89079)
留言168則, 86人參與, 2周前最新討論串1/1
最初本來只是在主力機只有一張4080在玩ComfyUI,後來看到一張便宜的3080 12G後 就收下來用想說其中一張卡跑一個較小的LLM,但入手後隨著想想玩的東西越來越多 東西也越買越多,最後就乾脆獨立一台。 而這台最終的組合是 X99 平台配五張 RTX 3060,合計 60 GB VRAM。以下大致照組 裝的順序記錄選料、踩到的坑與實際數據。 ▲ 完成後的樣子,開放式礦機架 https://i.urusai.cc/8OpY3.jpeg
【主機板與 CPU】 主機板、CPU 與散熱器是二手整組買的,2500 元。CPU 是 i7-5960X,主機板是 ASUS X99 Deluxe。 選這組的理由是 PCIe 通道配置。這張板子的 所有PCIe x16 插槽由 CPU 直出,不 需要額外的拆分卡就可以有5組 PCIe 3.0 x8插五張 GPU 。網路卡則插在 PCH 提供 的 PCIe 2.0 x4 上。 https://i.urusai.cc/nupyq.jpeg
【記憶體】 記憶體用 2 條 REG ECC 16 GB DDR4-2666。主機板與 CPU 的規格表只寫原生支援到 2133,但實際插上去會自動跑到 2666。 後來跟朋友借了 4 條 8 GB DDR4-3200 來試,四通道 DDR4-3200 也上得去,不過效 能似乎卡在 CPU IMC 本身的限制,跟雙通道 DDR4-2666 差距不大,所以最後就維持 原本那兩條 ECC。反正模型權重全部在 VRAM,主機記憶體只在載入時走一次。 【系統碟與模型儲存】 只配了一顆 256 GB 的 Kingston SKC600 SATA SSD 當系統開機碟。模型權重檔全部 放在 NAS 上,透過 SMB Direct 存取,本機不留副本。 【電源供應器】 電供是技嘉 P1000GM 1000W,RMA 回來未開封的,2000 元收到。它本身就有 6 個 PCIe 8pin 可以直接用,另外再自己做了幾條 SATA 轉 PCIe 6pin 的線,供電給 PCIe 轉接板。 【網路卡】 網路卡用 HPE 544FLR-QSFP+ 40G,很久以前買的,加轉接板一張幾百元。 因為 NAS 端目前是 25G/10G 的網路卡,所以必須加轉接頭降速成 10G 來用。不過 NAS 實際讀取上限大約 2 GB/s,網路卡只有10Gbps還算可以接受。 ▲ HPE 544FLR-QSFP+ 加轉接板 https://i.urusai.cc/Pv0nV.jpeg
【PCIe 延長方案】 延長走的是純被動方案:PCIe x8 轉 SFF-8654 x1,再用 SFF-8654 x1 轉回 PCIe x16。找閒魚上的委託代購,一組含線大約 500 元台幣。 ▲ 轉接板與 SFF-8654 線材 https://i.urusai.cc/JdYT3.jpeg
市面上容易找到的 PCIe x8 轉 SFF-8654 轉接板有兩種,線路看起來比較簡單的那 一種,要把板子上 R5 的電阻位置短路,否則插在主機板第一條 PCIe x16 以外的插 槽會偵測不到卡。 原因是這個電阻位置的兩端分別是 PRSNT1# 與 PCIe x8 的 PRSNT2#,主機板就是靠 這兩個接點有沒有導通,去判斷插槽上到底有沒有插介面卡。第一條插槽會過是因為 它本來就預期有卡,其他插槽就得靠這組訊號自己表態。 ▲ R5 位置補一點錫短路就正常了 https://i.urusai.cc/6mEaM.jpeg
【電力配置】 這台跟主力機共用一組 220V 的電源回路。兩台閒置時合計約 200~250W,LLM 跑起 來大概再加 650W;如果主力機的雙卡(4080 + 3080)同時在生圖或跑影片,總功耗 會衝到 1600W 以上。 ▲ 只有 LLM 在跑的時候 https://i.urusai.cc/9egUG.jpeg
▲ LLM 加上主力機生圖,220V 那一路來到 1651W https://i.urusai.cc/uMpSq.jpg
先前兩台加 NAS 都掛在同一組 110V/15A 回路上,不小心讓 LLM 跟生圖一起跑就會 直接跳電,後來乾脆自己拉了一路 220V/15A 專門給主力機和 LLM 用。NAS 因為接 110V 的 UPS,就繼續留在 110V。 【顯示卡】 五張 3060 是前兩個月陸續收的,單張 5500~6000 元。廠牌沒有統一,ASUS 的 ROG Strix、TUF、Dual 各一張,再加兩張 MSI──二手市場有什麼就收什麼,反正 VRAM 一樣大、跑起來也差不多。以目前新品的售價來看,現在大概很難再用這個價格收到了。 ▲ 五張 3060,廠牌與散熱器都不一樣 https://i.urusai.cc/tm2Hc.jpeg
【軟體與效能】 OS 是 Ubuntu 26,跑 llama.cpp。原本載入跟切換模型都靠 script 檔,後來覺得 太麻煩,就叫 Opus 寫了一個網頁控制介面。 ▲ llama.cpp 控制台,起停模型跟改參數都在這裡 https://i.urusai.cc/N85Ls.png
目前主要跑 Qwen3.6 27B Q8,開多模態與 MTP,模型與 KV 全部放在 VRAM, context 可以開到 256K。在 32K context 長度下,TTFT 48 秒、prefill 677 t/s、 decode 42 t/s。 補一下 Q4 與 Q8 在沒有 MTP 情況下的測試結果: ▲ llama-bench,Q4_K_M 對 Q8_0 https://i.urusai.cc/LFyNp.png
【花費總結】 RAM、SSD、網路卡、礦機架都是本來就有的,這次額外買的只有主機板加 CPU 加散 熱器、電源供應器,以及 PCIe 延長板。 ‧ 主機板 + CPU + 散熱器(二手整組):2,500 ‧ 電源供應器 P1000GM 1000W(二手未拆):2,000 ‧ PCIe 延長板:一組含線約 500,五組約 2,500 ‧ RTX 3060 x5:單張 5,500~6,000,合計約 2.8~3 萬 顯示卡以外的部分加起來大約 7,000 元。以 60 GB VRAM、能把 27B Q8 連同 256K context 整個放進 VRAM 來說還算划算吧 弄下來的一點感想是要搞多 GPU 門檻我覺得並不高。 AM5 平台大多支援把 PCIe x16 拆成 x8+x8、x8+x4+x4 或 x4+x4+x4+x4,再加上 CPU 直出的兩個 x4 M.2,配上 PCIe x16 轉 4x OcuLink 以及 M.2 轉 OcuLink 的 轉接板,就可以生出 6 組 PCIe 4.0 x4 給 6 張 GPU 用。AM4 也可以有 5 組。 我之前就是在 AM5 主力機上跑 PCIe 4.0 x8+x8+x4+x4。用 HWiNFO 看會發現 GPU 的 PCIe Error 計數器有一些數字,但實際運作沒遇到什麼問題;而如果降到 PCIe 3.0,這些錯誤計數就不會出現了。如果改用那種板上有 PCIe Redriver/Retimer 的 延長方案,應該就可以在 PCIe 4.0 下完全沒有錯誤,只是價格貴很多。 至於PCIe頻寬夠不夠,目前 3060 跑 --sm tensor 模式,在 PCIe 3.0 x8(跟 4.0 x4 差不多)下還是有明顯增益的。 接下來說一些建置過程中的測試調整,也有近期看到有人在討論的PCIe頻寬與TP議題 軟體設定修改與測試方面主要是由Codex與Claude Code處理的 下面的內容也是叫Codex/Claude Code撈出來整理的 要先補充的是另一台機器:主力工作站是 Ryzen 7 9800X3D 配約 64 GB DDR5-6000, 平常跑 ComfyUI 生圖,目前掛 RTX 4080 加 RTX 3080 兩張卡。多卡實驗最早就 是在它身上做的,後來卡片才陸續搬到專用伺服器。 卡片在這兩台之間流動過好幾次,這是下文所有測試的背景。順序大致是:主力工作 站先從兩張卡擴到四張,成為多卡實驗的第一個場地;接著才另外組了專用伺服器, 起初只有兩張 3060,中途曾把其中一張換成 3080 用來測異質組合,之後才逐步補 到四張、再到五張同型號的 3060。所以下文提到「這台」時,指的是當時正在測的 那一台,兩者的卡數與拓樸都不同。 最一開始是搞清楚單張 4080 跑得動什麼、能開多大 context。用的是官方 QAT 量 化的 Gemma 4 12B(gemma-4-12b-it-qat-q4_0.gguf,6.50 GiB,另加約 0.16 GiB 的 mmproj),RTX 3080 完全保留不用,正式 profile 設 262,144 context 配 Q8 K/V cache 與 Flash Attention。 ▲ 單卡 Gemma 12B:context 上限 32K vs 256K https://i.urusai.cc/gTBZK.png
這組數字給出了一個貫穿後續所有 context 決策的結論:把可用 context 上限從 32K 拉到 256K,短序列的解碼速度幾乎沒有變化(73.60 對 73.51)。換句話說, 增加 context 上限本身不必然拖慢生成,真正的成本在 KV cache 佔掉的容量,以 及長 prompt 的 prefill 時間。這條結論後來讓幾乎每個 profile 都敢把 context 開大,只在 VRAM 真的不夠時才往回收。 再往後上線的是 Gemma 4 26B A4B Uncensored HauhauCS Balanced Q4_K_M(15.64 GiB,約 26B 總參數配約 4B active),跑在 4080 加 CPU/RAM 上、排除 3080,同 樣是 131,072 context 與 Q8 KV。長時間日誌完成過一次 65,536-token 的連續生 成,平均 43.99 tok/s,另有約 49-50 tok/s 的一般生成紀錄──這證明它不只能 載入,還能長時間穩定輸出。 值得先記一筆的是:這顆 MoE 在「部分權重留在 RAM」的配置下仍有 44 tok/s。同 尺寸的 dense 模型在同樣情況下會慢得多,因為 MoE 每個 token 只啟用少數專家, 實際需要讀取的權重量少了一個量級。 再來是Gemma4-31B Opus Distill 的兩個量化──它們跑在同一組三張卡(3080 加 兩張 3060)上,唯一的關鍵差異是 KV cache 放在 GPU 還是 CPU: ▲ Gemma4-31B Opus Distill:KV 放 CPU vs 放 GPU https://i.urusai.cc/JdUKL.png
Q5 這邊還有更細的量測:載入後三張卡的剩餘量分別是約 2.3 GB、3080 只剩約 436 MB、約 1.05 GB;跑完一次 21K token 的 prefill 之後 3080 仍有約 418 MB, 確認了「idle 時的餘裕約等於穩態餘裕」──因為 KV 是在載入時就整塊預先配 置好的,不會隨著實際用量慢慢長大。生成速度約 11 到 12 tok/s,而且隨深度幾 乎平坦(0 深度 10.9、21K 深度 12.2),代表它是被層鏈中最慢的那張卡綁住,而 不是被 KV 綁住;prefill 在 21K prompt 時約 757 tok/s,首字約 28 秒。 兩相對照,把 KV 留在 CPU 的代價極高──Q6_K 的長生成只剩 4.16 tok/s,是 Q5 (KV 在 GPU)的四成不到,因為每個 token 的跨 PCIe 與 RAM 路徑成了熱點。但 Q6_K 換到的是 128K context(Q5 只有 96K),所以這是一筆刻意的交易而不是設 定失誤:需要長 context 就付速度,需要速度就收 context。 另外 Q5 的 3080 只剩不到 0.5 GB,這個量化已經不能再往上加 context。這也是 整段歷程反覆出現的一個規律:真正卡住的永遠是「最滿的那一張卡」,不是幾張卡 加起來的總量。三張 12 GB 看起來有 36 GB,但只要有一張先滿,整個配置就到頂 了。 主力工作站常常要跑ComfyUI,覺得要切換使用很麻煩,於是要搞了套X99,接下來的 多卡測試換到了另一台X99機器上。這台起初只有兩張 3060──兩張卡都是 Gen3 x16 直連 CPU root port下面幾組測試都是在這台上做的。 換到這台機器最大的一筆效能提升來自切換張量切分方式,而原本的預測完全相反: 這台沒有 P2P、卡間只有 5.57 GB/s 而且要繞主機記憶體,照直覺推斷 tensor parallel 應該不划算。 實測推翻了這個預測(Qwen3.6-27B Q4_K_M @ ctx32K,同一個 prompt、temp 0): ▲ Qwen3.6-27B:-sm layer vs -sm tensor(MTP 開/關) https://i.urusai.cc/J4w9f.png
TP 與 MTP 是乘法疊加的:18.3 經 TP 變成 30.9(1.7 倍),再經 MTP 變成 46 (又 1.5 倍),總共 2.5 倍。 原因在於 batch=1 的生成是記憶體頻寬瓶頸而不是通訊瓶頸:每一層的 all-reduce 只有大約 10 KB,幾微秒就傳完;而 -sm layer 的問題是同一時間只有一張卡在動, -sm tensor 則讓兩張卡同時計算每一層,等效頻寬因此翻倍。GPU 使用率的觀察 印證了這點──layer 模式下有一張卡閒著,tensor 模式下兩張都在 89% 與 92%。 得到的教訓是:不要用「PCIe 慢、沒有 NVLink、沒有 P2P」來推論 TP 不划算,那 個直覺只適用於大 batch 的 prefill。附帶好處是 tensor 模式的 VRAM 分配很平 均(10361/10353),不像 layer 模式那樣偏斜(9747/10949)。生成越長還越快: 114 token 是 34.6,300 token 45.4,800 token 45.8,8.6K prompt 則到 48.5 tok/s。 【把 PCIe 頻寬砍半來測 TP 的敏感度】 既然 TP 的收益這麼大,下一個問題就是它對頻寬有多敏感──如果換到頻寬更窄的 插槽還划算嗎?做法是用 setpci 把 root port 的 LNKCTL2 target speed 從 Gen3 降到 Gen2 再 retrain(這個改動不持久,重開機自動回復)。Gen2 x16 的 8.0 GB/s 約等於 PCIe 3.0 x8 的 7.88 GB/s,是很好的代理,因為軟體改不了 lane 數 只能改速度。 ▲ PCIe 由 Gen3 x16 降到 Gen2 對 TP 的影響 https://i.urusai.cc/Qbtgs.png
頻寬砍半只讓 prefill 掉 9%、decode 掉 5%,所以即使只有 x8 也該用 tensor (44.4 對 29.6,還是 1.5 倍)。對照組只掉 1% 與 0.4%,這證明量到的確實是 PCIe 的影響而不是雜訊。 更重要的是從這裡導出的洞察:痛不痛不是看頻寬,而是看「通訊佔計算時間的比例」。 主力工作站的 3080 掛在 PCH 後面的 PCIe 4.0 x4(7.88 GB/s,跟這裡的 Gen2 差不多),但那邊的 tensor prefill 卻直接腰斬(2123 掉到 1011)。差別 有兩個:一是 4080 與 3080 的算力約為 3060 的三倍,計算時間短,同樣的通訊量 佔比就大增;二是 PCH 多了一跳而且有 DMI 爭用,延遲遠高於直連 root complex。 所以單純從 x16 降到 x8 不痛,PCH 加上快卡才痛。 【P2P 解鎖:技術上成功,實用上幾乎沒有意義】 TP 既然靠卡間通訊,那把被鎖住的通道打開應該還能再快一點──這是很自然的下 一步。消費卡的 P2P DMA 被 NVIDIA 鎖住,但社群有開源分支可以解開,原本估計 「通訊約 5ms 一個 token,P2P 省一半就有 +10%」。 實際做法是把 BIOS 改成 OS Type=Other OS(Secure Boot 關閉)並開啟 Above 4G Decoding,驅動換成 .run 安裝的 610.43.03 userspace 加上 aikitoria/open-gpu-kernel-modules 的 610.43.03-p2p 自編未簽名模組(taint 12288),並補上 nouveau 黑名單與 update-initramfs -u、把三個 kernel 套件 apt-mark hold 住、開 NVreg_EnableResizableBar=1 加 grub 的 pci=realloc,以 及把 NCCL 的 P2P 層級設成 SYS。 ▲ P2P 解鎖前後:卡間頻寬 vs llama.cpp 實際效能 https://i.urusai.cc/bcS8a.png
原本估的 +10% 是錯的。CUDA 層確實開通了,但 llama.cpp 幾乎沒有受益──因為 llama.cpp 早就把通訊與計算重疊了,通訊根本不在關鍵路徑上,加速它省不到時間。 頻寬分析只在大 batch 的 prefill 才成立,而那正好就是唯一有改善的地方。這 也和前一節的結論互相呼應:既然頻寬砍半只掉 5%,把頻寬加倍自然也換不回多少。 另外三點值得記:NCCL_P2P_LEVEL=SYS 不設就等於整套白裝(NCCL 看到 PHB 拓撲 會預設走繞主機的路徑);ReBAR 生效的關鍵是 pci=realloc 而不是驅動版本 (GPU0 是 boot_vga,BAR 卡在 4G 以下,沒有 realloc 搬不上去),BAR1 因此從 256 MB 變成 16 GB;而把 patch 移植到舊驅動是死路──上游 fork 最新只到 570, 套到 595 有六個 hunk 失敗、全都在建立 peer PTE 的那段程式碼,手工補會靜 默地寫錯實體位址,比不能用還糟。 【-ts 有效,但 3080 的 12 GB 是個死結】 這台專用機中途曾把一張 3060 換成 3080,於是有了一組乾淨的異質卡環境可以驗 證 -ts(手動指定各卡分配比例)到底有沒有用──兩張卡都是 Gen3 x16 直連、沒 有 PCH 汙染。單卡的 tg128 是 3080 89.5、3060 42.1,所以理論最佳比例是 0.68/0.32。 ▲ 異質卡 -ts 比例掃描(3080 + 3060) https://i.urusai.cc/7v4B7.png
從均分調到正確比例是 +38%,而且是單調上升直到理論最佳點才 OOM──如果不設 -ts,快卡會完全被慢卡拖住。 但把整個組合背對背比較之後,結論卻很掃興: ▲ 3080+3060 與 2x3060 的 decode 背對背比較 https://i.urusai.cc/JJk8a.png
-ts 調校與 MTP 只能二選一,而 MTP 比較划算。要讓 3080 真正出力就得給它 68% 的層數,也就是 10.8 GB,再加上 MTP 的 context(458 MB)與 compute buffer 就爆掉 12 GB──ctx 試到 32k、16k、8k 全部 OOM,連 8192 都不行。核心問題是 3080 快 2.13 倍但 VRAM 跟 3060 一樣是 12 GB,速度配不上容量,要換 24 GB 的 卡才解得開。 換句話說,換上一張更快的卡並沒有換到更快的推論。這台機器最後的選擇是回頭走 同型號路線──與其湊一張快卡加一張慢卡,不如多放幾張一樣的卡,讓分配變簡單、 也讓每張卡的負擔平均。 【四卡一次到位】 四張 3060 到位之後,嘗試一次拿到「Q8 精度加 128K context 加多模態加 MTP」 全開。腳本用四卡 -sm tensor(同型號同速所以不需要 -ts,正好省掉上一節那個 兩難)、ctx 131072、Q8 KV、Flash Attention 打開、MTP 開啟,並為視覺任務加 上 --image-min-tokens 1024。 結果是一次就成功、零 OOM:VRAM 用掉 39,900 / 49,152 MiB(81%),每張卡還剩 1.5 到 2.6 GB,載入 56 秒。短文字生成 39.3 tok/s;8.6K prompt 的 prefill 是 836 tok/s、生成 48.2 tok/s;圖片 prefill 436 tok/s。最有說服力的是深層 驗證:52,551 token 的 prompt 以 760 tok/s 處理完,而埋在最開頭的密語被一字 不差地複述出來──這證明它不只是「能載入」,而是真的記得住。 那麼加卡到底買到了什麼? ▲ 2x3060 vs 4x3060:加卡的邊際效益 https://i.urusai.cc/Xwtle.png
擴展是次線性的,效率大約 0.33,因為 4-way all-reduce 的通訊成本吃掉了大半 算力紅利。但加卡的真正價值不是速度而是容量──四卡跑 Q8(836 / 48.2)全面 勝過雙卡跑 Q4(664 / 45.7),等於精度翻倍、context 翻倍、圖片快十倍,而速 度不減。 其中「圖片快十倍」值得單獨說明:四卡最大的好處是 mmproj 可以放上 GPU。雙卡 時 VRAM 不夠,必須讓視覺編碼器跑在 CPU 上,圖片 prefill 只有 46 tok/s;四 卡放上 GPU 之後(GPU0 多吃 1.1 GB)跳到 436 tok/s。 補充有人提問的Qwen3.6 35B A3B Q4的測試 https://i.urusai.cc/9r7pc.png
-- ※ 發信站: 批踢踢實業坊(ptt.cc), 來自: 218.161.18.24 (臺灣) ※ 文章網址: https://www.ptt.cc/bbs/PC_Shopping/M.1786274152.A.A50.html

08/09 19:26, 4周前 , 1F
感謝分享
08/09 19:26, 1F

08/09 19:29, 4周前 , 2F
先推,拉220V的都是狠人 XD
08/09 19:29, 2F

08/09 19:39, 4周前 , 3F
推經驗分享,一般而言這些實測多不會分享
08/09 19:39, 3F

08/09 20:02, 4周前 , 4F
推經驗分享
08/09 20:02, 4F

08/09 20:06, 4周前 , 5F
推經驗分享,這些細節很難看到。
08/09 20:06, 5F

08/09 20:07, 4周前 , 6F
可以寫論文了XD
08/09 20:07, 6F

08/09 20:19, 4周前 , 7F
推!
08/09 20:19, 7F

08/09 20:27, 4周前 , 8F
超猛 玩LLM我最後還是覺得訂閱線上便宜
08/09 20:27, 8F

08/09 20:27, 4周前 , 9F
的用就好…
08/09 20:27, 9F

08/09 20:47, 4周前 , 10F
推一下細節分享 我最近也動腦筋到
08/09 20:47, 10F

08/09 20:47, 4周前 , 11F
這種事 學習了
08/09 20:47, 11F

08/09 21:00, 4周前 , 12F
超猛,相比看不下去的好像分享了什
08/09 21:00, 12F

08/09 21:00, 4周前 , 13F
麼又好像什麼都沒分享
08/09 21:00, 13F

08/09 21:01, 4周前 , 14F
08/09 21:01, 14F

08/09 21:13, 4周前 , 15F
08/09 21:13, 15F

08/09 21:41, 4周前 , 16F
08/09 21:41, 16F

08/09 21:43, 4周前 , 17F
超猛,根本小論文
08/09 21:43, 17F

08/09 22:07, 4周前 , 18F
好奇問這種可以做影片嗎?MJ VS Dio之類
08/09 22:07, 18F
跑影片模型的話不會多快,影片模型偏重計算而3060單卡算力太弱了 影片的話我是另一台4080+3080 12G去跑的

08/09 22:37, 4周前 , 19F
PTT電蝦所口試論文
08/09 22:37, 19F

08/09 22:37, 4周前 , 20F
如果RAM是ECC的,可以考慮升級EPYC,7
08/09 22:37, 20F

08/09 22:37, 4周前 , 21F
卡不是夢(?
08/09 22:37, 21F

08/09 22:37, 4周前 , 22F
而且基本功耗可以少個100瓦以上...
08/09 22:37, 22F
是有考慮過EPYC,但主機板二手價都不便宜。 理想上PCIe 4.0x8 x8卡+128GB 8通道DDR4,做部分CPU Offload可以跑更大的模型 不過記憶體目前也還在漲....

08/09 22:56, 4周前 , 23F
最近也在研究,感謝分享
08/09 22:56, 23F

08/09 22:58, 4周前 , 24F
推 電蝦論文
08/09 22:58, 24F

08/09 23:21, 4周前 , 25F
我現在很認真在考慮要不要搞個兩張4090D
08/09 23:21, 25F

08/09 23:21, 4周前 , 26F
48G來塞我的全精度qwen3.8 27b...
08/09 23:21, 26F
也有想過玩魔改卡但有點擔憂耐用度,反覆加熱及沒原廠焊接品管,且單卡也不便宜

08/09 23:32, 4周前 , 27F
好猛喔 可以跑什麼模型 是不是影片什
08/09 23:32, 27F

08/09 23:32, 4周前 , 28F
麼都一下就算出來了
08/09 23:32, 28F

08/09 23:40, 4周前 , 29F
其實我也是玩了一堆方案 我自己心得
08/09 23:40, 29F

08/09 23:41, 4周前 , 30F
就是 直接買DGX就好....
08/09 23:41, 30F

08/09 23:53, 4周前 , 31F
謝謝原po和seemoon2000
08/09 23:53, 31F

08/10 00:05, 4周前 , 32F
結論 能一張大卡 就一張大卡 省事XD
08/10 00:05, 32F
會搞這個的其中一個原因就是買不起大卡&DGX&大容量Strix Halo...

08/10 00:26, 4周前 , 33F
PTT到底還是學術論壇
08/10 00:26, 33F

08/10 00:31, 4周前 , 34F
推分享
08/10 00:31, 34F

08/10 00:47, 4周前 , 35F
推推
08/10 00:47, 35F
還有 94 則推文
還有 3 段內文
08/10 15:07, 3周前 , 130F
只能跪了…
08/10 15:07, 130F

08/10 15:14, 3周前 , 131F
這文一定要推的, 感謝分享啊!!
08/10 15:14, 131F

08/10 15:17, 3周前 , 132F
你的工作是當礦工嗎?拿AI的生產力跟挖礦比
08/10 15:17, 132F

08/10 15:17, 3周前 , 133F
,叫那些挖礦軟體寫幾段程式來看看
08/10 15:17, 133F

08/10 16:06, 3周前 , 134F
Local ai需要展現更大的需求 廠商
08/10 16:06, 134F

08/10 16:06, 3周前 , 135F
才會 care 出更多產品
08/10 16:06, 135F

08/10 16:17, 3周前 , 136F
回94樓,sata就是容易燒在接頭,針腳太密
08/10 16:17, 136F

08/10 16:18, 3周前 , 137F
自己做用好線也沒啥用,有點像現在災難的
08/10 16:18, 137F

08/10 16:18, 3周前 , 138F
12VHPWR
08/10 16:18, 138F

08/10 16:35, 3周前 , 139F
有轉接都會燒 不過問題在12V倒灌
08/10 16:35, 139F

08/10 16:35, 3周前 , 140F
其實跟線材關係不大 PCB Trace都會燒了
08/10 16:35, 140F

08/10 16:36, 3周前 , 141F
但目前沒有電源廠有意識到12V倒灌的問題
08/10 16:36, 141F

08/10 16:36, 3周前 , 142F
solution也是沒防 土砲多卡只能多燒香
08/10 16:36, 142F

08/10 16:44, 3周前 , 143F
組一台做影片的,投稿紅果XD
08/10 16:44, 143F

08/10 17:45, 3周前 , 144F
在正經用ComfyUI的話這配備是很可以但不是
08/10 17:45, 144F

08/10 17:46, 3周前 , 145F
很推,流水線用5090兩張能最快交件。再上
08/10 17:46, 145F

08/10 17:48, 3周前 , 146F
去沒那麼划算,說到底就是X99之後就沒類似
08/10 17:48, 146F

08/10 17:48, 3周前 , 147F
切性能切太大塊的方案了...
08/10 17:48, 147F

08/10 19:30, 3周前 , 148F
強 推一個
08/10 19:30, 148F

08/10 20:13, 3周前 , 149F
08/10 20:13, 149F

08/10 20:15, 3周前 , 150F
現在好像都沒有x99 x299這種平台出來了
08/10 20:15, 150F

08/10 20:15, 3周前 , 151F
08/10 20:15, 151F

08/10 20:23, 3周前 , 152F
猛,但我不是客群xd
08/10 20:23, 152F

08/10 21:08, 3周前 , 153F
推,強者
08/10 21:08, 153F

08/10 23:12, 3周前 , 154F
感謝分享那麼多寶貴的設定細節,X99萬歲
08/10 23:12, 154F

08/10 23:16, 3周前 , 155F
最寶貴的是多卡TP在不同PCIE下速度比較
08/10 23:16, 155F

08/10 23:16, 3周前 , 156F
看來最大重點就是卡不能掛在PCH的PCIE上
08/10 23:16, 156F

08/10 23:18, 3周前 , 157F
08/10 23:18, 157F

08/11 00:33, 3周前 , 158F
雖然看不懂 不過給個推
08/11 00:33, 158F

08/11 01:40, 3周前 , 159F
跪的腳好麻
08/11 01:40, 159F

08/11 07:47, 3周前 , 160F
優質文 推推
08/11 07:47, 160F

08/12 02:19, 3周前 , 161F
推優質論文(?
08/12 02:19, 161F
※ 編輯: laeva75 (218.161.18.24 臺灣), 08/12/2026 07:06:19

08/12 09:13, 3周前 , 162F
高手
08/12 09:13, 162F

08/13 16:01, 3周前 , 163F
p2p要在同一個PCIe Switch 之後才能發
08/13 16:01, 163F

08/13 16:01, 3周前 , 164F
揮最大效率,GPU 之間的DMA不需要經過r
08/13 16:01, 164F

08/13 16:01, 3周前 , 165F
oot complex
08/13 16:01, 165F

08/13 16:06, 3周前 , 166F
PCIe有error,大部分就是重送一次封包,
08/13 16:06, 166F

08/13 16:06, 3周前 , 167F
所以error多會明顯影響速度
08/13 16:06, 167F

08/21 11:09, 2周前 , 168F
08/21 11:09, 168F
文章代碼(AID): #1gU65efG (PC_Shopping)
文章代碼(AID): #1gU65efG (PC_Shopping)