推文
@Leoskie_L · 2026-08-19 07:57
這真是徹頭徹尾的瘋狂。 USB-C 線,對,就是你平常插外接硬碟那條線,現在直接變成 CUDA 記憶體跟 Apple Metal 統一記憶體之間的 RDMA 通道。 Mac 可以單邊 WRITE 進 Spark 的 CUDA-mapped memory,Spark 也可以單邊 WRITE 回 Mac 的 unified memory。沒有 master/slave,verbs 兩邊一樣,registered memory、rkeys、credit flow control 全部到位。24 微秒 round-trip,小訊息每秒 4 萬次。 量測過的數字: 單線 939 MB/s 兩條線同時打,Mac → 兩台 Spark 1.80 GB/s 兩台 Spark → Mac 1.25 GB/s 等一下,你有沒有想過這東西到底在幹嘛? 以前要把 NVIDIA 的 prefill 結果丟給 Apple 的 decode,中間要經過一層 copy、一層 host、一層再 copy。現在直接開一扇窗,鍋子從左邊廚房遞給右邊廚房,不用走出後門。 Spark 負責 prompt processing(CUDA 算力強的地方),Mac Studio 負責 decode(統一記憶體頻寬兇的地方)。兩台 Spark 各拉一條獨立 USB-C 進同一台 Studio,兩邊同時灌,結果寫回任何一邊都可以。 物理層就卡在這裡:USB4 controller 目前還被鎖著,沒有 train 到滿速。頭都已經探出來了,線材本身還沒被榨乾。 這不是軟體優化。這是記憶體地址空間直接打通。 你覺得如果 controller 解鎖,這條線還能再推多遠?
曝光 21272 · 评论 21 · 点赞 92 · 书签 42