垃圾场集群:用60美元二手GPU运行LLaMA-70B推理服务 DumpsterCluster: From Dumpster Diving to Serving LLaMA-70B on $60 GPUs
二手V100组建128卡集群,靠流水线优先并行低成本跑LLM推理,但碳可行性取决于绿电。
前置知识
张量并行(TP)与流水线并行(PP)
张量并行把单个层的权重矩阵按列/行切分到多张卡上,每层前向都需要 scatter/gather 或 all-reduce 通信;流水线并行则把模型按层切成若干阶段,每张卡(或每组卡)完整持有连续若干层,多个请求微批以流水线方式填满各阶段,跨卡只在阶段边界传一次激活。vLLM、SGLang 等主流推理系统的默认启发式是节点内先做张量并行、再向跨节点扩展流水线/序列并行,即 TP-first。
本文核心主张就是反转这一默认顺序:旧卡应该采用设备级流水线优先(PP-first),每卡完整承载一层。不理解两种并行的通信模式差异,就无法理解整个方法设计。
访存受限与 compute-to-bandwidth 比率
按 Roofline 模型,当硬件算力(TFLOPs/s)与显存带宽(GB/s)之比较大时,性能受带宽限制(访存受限),此时聚合更多卡的 HBM 带宽能加速解码;比率较小时则受算力限制。LLM 解码阶段通常访存受限,H100/B200 的比率约 0.28-0.29 TFLOPs/GB,而 V100 只有 0.13 TFLOPs/GB——它带宽相对充裕,瓶颈在算力、显存容量和卡间互联。
这是论文论证『为什么 vLLM 的 TP-first 策略在新卡上合理、在 V100 上反而次优』的定量核心,也是 PP-first 设计的第一性原理(Table 1 的关键行)。
隐含碳(embodied carbon)与运行碳(operational carbon)
隐含碳 $C_{em}$ 是制造硬件产生的碳排放,本文按 $C_{em} = C_{die} + C_{VRAM} + C_{periph}$ 估算:逻辑裸片面积乘以单位面积碳强度,加上 HBM 容量乘以单位容量碳强度,再加上每台服务器约 150 kg CO2e 的外设碳;运行碳 $C_{opt}$ 是使用期电力消耗的碳排放,$C_{opt} = E_{DC} \times I$(能耗乘电网碳强度)。两者加总为 $C_{total}$,再按生成的 token 数归一化。
二手 GPU 的全部环境论证都建立在这对概念上:复用摊薄了隐含碳,但旧芯片低能效抬高了运行碳,最终结论取决于两者之和在哪种电网下更小。
电网碳强度与 PUE
碳强度 $I$(gCO2/kWh)衡量每度电对应的二氧化碳排放,由电网能源结构决定:本文取美国约 20% 可再生(393 gCO2/kWh)、中国约 30%(584)、巴西约 90%(97)、中国风电约 100%(约 10,即全绿电仍保留基础设施生命周期残余排放)。PUE(电能使用效率)是数据中心总能耗与 IT 设备能耗之比,本文统一取 1.2,把服务器功耗换算为整站能耗 $E_{DC} = E_{server} \times PUE$。
论文『旧卡必须与低碳电力战略性耦合部署』这一核心结论完全由这两个参数驱动,理解它们才能读懂四电网、三摊销期的敏感性分析。
TPS 与 TCO(USD per million tokens)
TPS(Tokens Per Second)是推理服务的解码吞吐,直接决定用户体验和按 token 计费 API 的收入上限;TCO 分析把资本开支(买硬件)与运营开支(电费)在 3/5/8 年部署周期上摊销,统一换算成 USD/MT(每生成一百万 token 的美元成本),使不同硬件、不同电价、不同模型规模可以放在同一张表上比较。
全文所有实验表(Table 2、3、6-9)都以 TPS、USD/MT、gCO2/MT 为坐标轴,是评估『DumpsterCluster 到底划不划算』的度量衡。
研究动机
AI 数据中心的快速迭代制造了大规模『功能性退役』:仅 2023 年 NVIDIA 就向数据中心出货超过 300 万颗 GPU 芯片,而数据中心 GPU 通常约 3 年(与保修期对齐)就被新一代产品替换,每个周期都有数百万张仍完全可用的卡流入二手市场。与此同时,一套 8 卡 B200 系统标价约 60 万美元,把最先进的 AI 基础设施挡在多数研究者和中小机构门外;先进 GPU 产能集中在极少数厂商与代工厂,紧缺期采购延迟长达 6-12 个月甚至拿不到配额;持续制造新加速器还带来大量制造阶段隐含碳和电子垃圾。可负担性、供应链安全、环境可持续三条压力线共同指向一个未被认真检验的问题:这些『被丢弃』但仍有算力的卡,能否被重新组织起来服务现代 LLM 推理。
本文的目标是本文的目标是用真实的工程实践而非纸面估计来回答:退役 GPU 组成的『DumpsterCluster』能否以有竞争力的吞吐服务 LLaMA-70B 级别的现代大模型推理,并系统刻画它在什么条件下经济上划算、环境上真正可持续。具体拆成三件事:(1) 从零搭建一个完全使用二手件——GPU、主板、CPU、内存、网卡全部二手——的 128 卡 V100 集群,并实际运营一年;(2) 开发针对性的推理引擎,克服旧卡显存小(16GB)、带宽低(900 GB/s)、互联慢(300 GB/s NVLink)的三大约束;(3) 用统一的 TCO 与碳足迹框架,结合二手市场价格衰减曲线和四个地区的电网数据,给出『何时该部署旧卡、何时不该』的量化决策依据。
与已有工作不同的是,已有工作要么在新硬件上做推理系统优化(vLLM、SGLang),要么在纸面上做数据中心碳核算,两条线很少交叉;对二手 GPU 的讨论多停留在报价观察。本文的独特切入是『先真的建、再认真算』:作者实打实用批量价 60 美元的二手 V100(比 B200 便宜百倍以上)组装 128 卡集群,运营 12 个月并记录全部 58 起故障事件;软件上提出主流系统没有的设备级流水线优先并行加 CPU 异步通信的组合;分析上首次把拉伸指数价格衰减模型、两种碳核算口径(extended/zero embodied)与四个地区电网统一进同一张决策表,最终给出『GPU 第二生命并非普适可持续,必须与低成本低碳电力战略性耦合』这一有条件、可操作的结论。
核心方法
直觉上,单张 V100 的短板——16GB 显存装不下 70B 模型、900 GB/s 带宽只有 H100 的 27%、NVLink 300 GB/s 只有 H100 的三分之一——都是『单卡视角』的问题;用 128 张卡横向扩展并改变模型切分方式即可绕开。技术路线分四层:(1) 硬件层:16 台 8 卡 V100 SXM 服务器组成一个 pod,NVLink 只在每 4 卡一组内有效,跨节点走 100G RDMA,整套 2024 年约 3.2 万美元、2026 年 3 月已跌到约 2.2 万美元;(2) 并行层:自研 Rust 推理引擎采用设备级流水线优先策略,每卡至少完整承载一层,LLaMA-70B 被切成最多 80 个流水线阶段;(3) 通信层:所有跨卡数据传输由 CPU 异步预取完成,与 GPU 计算重叠以隐藏延迟;(4) 分析层:以 $C_{total} = C_{opt} + C_{em}$ 和 USD/MT 为度量,在三类负载、两个模型规模、四种电网上做经济性与碳足迹敏感性分析。
核心创新是把『选哪种并行』还原为硬件的 compute-to-bandwidth 比率问题。H100/B200 的算力带宽比约 0.28-0.29 TFLOPs/GB,解码高度访存受限,所以 vLLM 等系统 TP-first、用张量切分聚合 HBM 带宽是正确设计;V100 比率只有 0.13 TFLOPs/GB,带宽相对充裕而算力、显存容量、卡间互联才是瓶颈,此时 TP 的 scatter-gather 通信纯属浪费——正确做法是把整层放进一张卡、按层切出最深的流水线(LLaMA-70B 达 80 级),跨卡只需传层输出,带宽需求仅 3.125 GB/s,远低于集群互联能力。第二个关键设计是通信宿主从 GPU 迁移到 CPU:朴素流水线让 GPU 自己调 NCCL 收发,kernel launch 会阻塞两端 GPU 造成流水线气泡;本文让 CPU 异步管理全部跨卡传输,GPU 计算第 $t$ 步时 CPU 已预取第 $t+1$ 步输入,把通信时间完全隐藏在计算之下。这两点的组合在商品化服务系统中并不存在。
方法步骤详情
完整流程如下。(1) 采购与分箱:2024 年 5 月以 215 美元/卡、7 月以 170 美元/卡购入二手 V100(现价 50-60 美元),对 GPU、CPU、主板全部压力测试分箱,剔除到货即坏与易早衰个体。(2) 组装:每台服务器含 2 块 SXM 底板共 8 张 V100,底板上两个 PCIe 3.0 switch 各连 2 张 100G ConnectX-5 网卡;计算板为双路 Xeon 6138 加 256GB DRAM;4 张网卡上联 100Gbps RDMA fabric,另配 25Gbps 管理口;16 台服务器组成一个 128 卡 pod,作者共部署两个。(3) 并行规划:模型按层切分、每卡至少一层,70B 最多 80 级流水线,可在最后阶段叠加张量并行。(4) 运行时:请求组成连续批次沿流水线流动,CPU 在 GPU 算第 $t$ 步时异步预取并发送第 $t+1$ 步激活。(5) 运维:额外部署 10% 冗余 GPU 并做负载均衡。(6) 评测:在 Prefill-heavy(输入 1,259/输出 128)、Decode-heavy(199/1,024)、ShareGPT(500 条真实对话)三类负载下,测 LLaMA 3.1-8B/70B 的 TPS、四电网 USD/MT、3/5/8 年 TCO 与 gCO2/MT,基线为 vLLM 上的 B200/H100/A100。
技术新颖性
新颖性有四层。(1) 实证对象新:首个全二手件(含主板、CPU、内存、网卡)从零搭建并公开一年真实运营数据(含逐条故障记录)的 LLM 推理集群研究,此前无人给出旧卡跑 SOTA 模型的实测吞吐。(2) 系统设计新:设备级(而非业界常见的 4-8 卡节点级)流水线,深度达 80 级,配合 CPU 侧异步通信消除 NCCL 气泡;论文还给出反转 vLLM/SGLang TP-first 默认顺序的定量依据(compute-to-BW 比率 0.13 对 0.29)。(3) 建模工具新:用拉伸指数衰减 $P(t) = P_0 \cdot e^{-(t/\tau)^\beta}$ 拟合二手价曲线,发现 $\beta > 1$ 的加速贬值规律(V100 $\tau$=48.3 月、$\beta$=2.43,$R^2$=1.000;A100 61.7 月、4.66)。(4) 会计口径新:对复用硬件同时报告 extended(隐含碳摊到第二生命并乘 1.1 冗余系数)与 zero embodied(视为免于填埋、隐含碳记零)两个边界口径,避免单一核算框架的立场偏倚。
实验结果
逐项看实验。(1) 8B Prefill-heavy:128 卡 V100 达 223,936 TPS,反超单卡 B200 的 62,651 TPS(3.6 倍),GPU 开支仅 $7.68K 对 $75K,TPS/$ 为 29.16 对 0.84(约 35 倍)。(2) 8B ShareGPT:21,504 对 43,911 TPS,吞吐一半但 TPS/$ 约 4.8 倍。(3) 8B Decode-heavy:8,128 对 26,037 TPS,解码负载是旧卡短板(4 卡 pod 仅 254 TPS)。(4) 70B Prefill-heavy:1,512 TPS,约为 8 卡 B200(37,045)的 1/25,但资本开支低 78 倍,TPS/$ 约 3.2 倍于 B200;单张 16GB V100 装不下 70B,全靠 80 级流水线才『能跑』。(5) 扩展性:70B 从 16 卡 189 到 128 卡 1,512 TPS,8 倍设备换 8 倍吞吐,严格线性;8B 4 卡到 128 卡亦随 32 倍设备数近线性增长。(6) TCO:中国电价下 8B 五年期 V100 $0.0007/MT 对 H100 $0.0042,最多 6 倍优势;70B 下 V100 三年期成本反为 H100 的 1.5 倍(67% 成本效率);作者指出二手 A100 80GB 方案多年期口径下反而最具成本效益。(7) 碳:电网平均碳强度下 V100 碳足迹 8B 约 3.7 倍、70B 约 41 倍;全风电下 8B Prefill 降至 0.31/0.11 对 0.07 gCO2/MT。(8) 可靠性:一年 58 起事件仅 8 起真硬件故障(年化设备故障率 6.25%),与 10% 冗余吻合。(9) 商业对照:Together AI 定价 8B/70B 为 0.10/0.88 USD/MT,旧卡方案仍有可观利润。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| LLaMA 3.1-8B Prefill-heavy 推理吞吐 | TPS (tokens/s) | 128×V100:223,936(16×V100 规模下约 29.16 TPS/$) | 1×B200(vLLM v0.17):62,651;1×H100:29,343;1×A100 80GB:12,451 | 吞吐为 B200 的 3.6 倍,GPU 资本开支低约 10 倍($7.68K vs $75K),TPS/$ 约 35 倍(29.16 vs 0.84) |
| LLaMA 3.1-8B ShareGPT 真实对话负载 | TPS | 128×V100:21,504 | 1×B200:43,911;1×H100:9,312 | 绝对吞吐约为 B200 的一半,但按 TPS/$ 计约 4.8 倍(2.80 vs 0.59) |
| LLaMA 3.1-8B Decode-heavy 负载 | TPS | 128×V100:8,128(4×V100 pod 仅 254) | 1×B200:26,037;1×H100:11,506 | 绝对吞吐约 0.31 倍,解码类负载是旧卡短板,反映深流水线对自回归串行生成的局限 |
| LLaMA 3.1-70B Prefill-heavy 推理吞吐 | TPS | 128×V100:1,512(16×V100 仅 189) | 8×B200:37,045;8×H100:19,885;8×A100 80GB:8,642 | 绝对吞吐约 1/25,但资本开支低 78 倍($7.68K vs $600K),TPS/$ 约 3.2 倍于 B200 系统 |
| LLaMA 3.1-70B Decode-heavy 负载 | TPS | 128×V100:2,536 | 8×B200:24,695;8×H100:10,372 | 绝对吞吐约 0.1 倍;16 卡 pod 仅 317 TPS,说明深流水线是该规模下的必需而非可选 |
| 三年 TCO(中国电网,约 30% 可再生) | USD/MT | 8B:0.0008;70B:0.12 | 8B:B200/H100/A100 均约 0.01;70B:H100 0.08、B200 0.17 | 8B 成本约为新卡方案的 1/6 至 1/12;70B 则反转为 H100 的 1.5 倍(67% 成本效率),规模越大优势越小 |
| 碳足迹(电网平均碳强度,中国约 30% 可再生) | gCO2/MT | 8B:6.85/6.65(extended/zero embodied);70B:1,014.91/985.40 | 8B:B200 1.84、H100 2.82;70B:B200 24.62、H100 32.74 | 碳劣势:8B 约 3.7 倍、70B 约 41 倍——化石能源主导电网下旧卡显著增碳 |
| 碳足迹(100% 中国风电) | gCO2/MT | 8B Prefill:0.31/0.11;70B Prefill:46.45/16.93 | 8B:B200 0.07;70B:B200 0.61 | 绿电下差距大幅收窄,8B zero-embodied 口径(0.11 vs 0.07)已接近持平;70B 仍有约 27 倍差距 |
| 128 卡 V100 集群一年实运可靠性 | 故障事件与年化设备故障率 | 58 起事件:32 次 PCIe 复位(55.2%)、18 次软件复位(31.0%)、5 次 CPU 故障、2 次 NIC 故障、1 次 GPU 故障;年化设备故障率约 6.25% | 文献中数据中心 GPU 5 年生存率约 90%(Ostrouchov 等) | 真硬件故障仅占 13.8%,86.2% 可软件恢复;分箱加 10% 冗余后可靠性达到生产可用水平 |
| 二手市场价格衰减建模 | 拉伸指数拟合参数与贬值幅度 | V100:$\tau$=48.3 个月、$\beta$=2.43($R^2$=1.000);A100:61.7 个月、4.66(0.9997) | V100 从发售价 $10,000 跌至 $60;A100 从 $12,000 跌至 $1,900 | $\beta > 1$ 表明加速贬值:V100 贬值 99.4%、A100 84.2%,为旧卡集群的超低资本开支提供市场证据 |
局限与改进
作者承认的局限:(1) 只适用于推理不适用于训练——梯度同步需要高卡间带宽(V100 NVLink 300 对 H100 900 GB/s),大 batch、FP32 精度与数周连续运行会放大旧卡故障率和检查点回滚的重算代价;(2) 环境收益强依赖电网碳强度,化石电网下旧卡『省隐含碳、增运行碳』可能净增排放;(3) 市场悖论——若方案普及推高二手价,论文的经济优势数字会失效;(4) 无厂商保修,需自建硬件诊断与维修能力,运维开销高于新硬件。我补充的观察:(5) 70B 绝对吞吐差距大(1,512 对 37,045 TPS),只适合延迟不敏感的批处理场景,所谓 3.2 倍性价比是按资本开支摊出来的,交互式产品难以接受 10-25 倍的吞吐差;(6) 基线软件栈版本不齐——B200 用 vLLM v0.17、H100/A100 用 v0.65,脚注还出现 v0.6 的矛盾表述,且 Table 9 中 H100/A100 在 ShareGPT 下吞吐(5,265/3,402)异常偏低,基线调优程度存疑;(7) 碳核算排除了回收与填埋的末端排放,B200 隐含碳因数据缺失用最近工艺节点推算(表中带星号),不确定性较大;(8) 缺少单卡 V100 基线(16GB 装不下 70B),部分对比是『128 卡集群对 8 卡 pod』的不对等粒度。
独立分析的弱点
独立分析的弱点与改进方向:(1) 能效鸿沟是工艺级的——V100 的 TSMC 12nm 加 HBM2 决定了每 token 能耗数倍于 H100,软件无法根治;改进方向:为旧卡定制 DVFS/功耗封顶策略,把调度目标从时延改为每 token 能耗。(2) 解码并行度不足:Decode-heavy 下 4 卡 pod 仅 254 TPS、128 卡也只有 8,128 TPS,说明深流水线对自回归解码的串行依赖无能为力;改进方向:prefill/decode 分离部署、用小模型做 speculative decoding、chunked prefill 与更大连续批处理。(3) 可靠性样本单薄:单一集群一年 58 起事件不足以外推故障率,没有季节性、批次差异和磨损曲线分析;改进方向:多站点长周期跟踪,结合 SMART 数据做故障预测,动态调整冗余比例。(4) 碳分析用年均碳强度,未做逐小时粒度;改进方向:碳感知调度,让请求实时流向低碳时段或低碳地区(follow-the-sun)。(5) 经济结论电价敏感:8B 的 6 倍优势高度依赖中国工业电价 $0.0556/kWh,电价上浮、自建制冷或土地成本都会收窄优势;应补充电价-盈亏平衡曲线和 PUE 敏感性分析。
未来方向
作者提出的方向:与可再生电力共址部署,用旧卡消纳本会被弃风弃光的电力;跨能源市场地理多样化部署,对冲能源价格波动与单一电网的政策风险;坚持『推理优先』定位,因为模型只训练一次却要服务数十亿次查询。基于本文成果可延伸:(1) 异构混编集群——新卡做 prefill、旧卡做 decode 的解耦架构,或旧卡跑 draft 模型的投机解码;(2) 量化适配——INT4/AWQ 等低比特量化让 16GB 旧卡装下更大模型,降低流水线深度和通信次数;(3) 碳感知调度器——接入实时电网碳强度 API 做请求级路由与批处理决策;(4) 低带宽训练任务——LoRA/QLoRA 微调对互联带宽要求远低于全参数训练,可能落在旧卡能力圈内;(5) 市场弹性建模——把『采用量推高二手价』的反馈回路引入 TCO 模型,预测方案普及后的价格走势与最佳采购窗口;(6) 软件开源化——把 Rust 引擎的设备级流水线与 CPU 异步通信抽象为可插拔后端贡献回 vLLM/SGLang 生态,让方案 beyond 论文可复用。
复现评估
硬件复现门槛低、路径清晰:所有部件均可在二手市场购得,pod 整机 2024 年约 3.2 万美元、2026 年 3 月约 2.2 万美元(单卡 50-60 美元),论文给出完整拓扑(Figure 3)与型号清单(V100 SXM 底板、双路 Xeon 6138、256GB DRAM、ConnectX-5 100G 网卡、100Gbps RDMA fabric、25Gbps 管理口)。软件是最大障碍:自研 Rust 推理引擎未提及开源,设备级 80 级流水线加 CPU 异步通信属于高工程量的定制开发,完整复刻需要数人月的系统工作。评测协议完全可复现:三类负载的 token 分布(Table 5)、电网价格与碳强度数据源(EIA/CEIC/Ember 2023,Table 4/10)、碳核算全部公式(式 (1)-(10),含 PUE=1.2、外设 150 kg CO2e/服务器、1.1 冗余系数)均已公开;基线方面 B200 用 vLLM v0.17、H100/A100 用 v0.65,版本对齐后数字可能略有出入。总体:结果验证(复测吞吐与成本)中等偏易,系统级复刻中等偏难,算力门槛约 2.2 万美元起,远低于任何新卡方案,适合高校实验室级别的复现。
论文图表
V100 16GB(2018 年 5 月发售价 $10,000)与 A100 40GB(2020 年 5 月发售价 $12,000)自发布以来的 eBay 二手市场价格散点及拉伸指数衰减拟合曲线(对数价格轴)。V100 依次跌至 $130、$85、$60(贬值 99.4%),A100 跌至 $4.3K、$2.6K、$1.9K(贬值 84.2%);数据点只覆盖发布后 3-4 年起,即从超大规模数据中心批量退役后的市场价。
该图给出全文经济分析的定价基础:旧卡在生命周期末期加速贬值($\beta > 1$),60 美元的 V100 使 128 卡集群的资本开支仅为 8 卡 B200 系统的零头,是『DumpsterCluster 可行』的第一前提。
一年实运的 58 起故障事件分解:PCIe 复位 32 起(55.2%)、软件复位 18 起(31.0%)、CPU 故障 5 起(8.6%)、NIC 故障 2 起(3.4%)、GPU 故障 1 起(1.7%);真硬件故障合计仅 13.8%,其余 86.2% 可通过软件干预(服务重启/节点重启)恢复。
直接回应二手硬件可靠性这一最大质疑:分箱加 10% 冗余后年化设备故障率约 6.25%,多数事件软件复位即可恢复,为『旧卡可用于生产』提供了目前唯一的长期实证数据。
四个部署地区的电网参数:中国(约 30% 可再生、584 gCO2/kWh、$0.0556/kWh)、美国(约 20%、393、$0.12)、巴西(约 90%、97、$0.125)、中国可再生(约 100%、约 10、$0.0556);数据源自 EIA/CEIC/Ember 的 2023 年工业电价与电网排放因子。
TCO 与碳足迹所有计算的外生输入都来自这张表,是复现经济与环境结论的必备参数集。
三类评测负载的 token 分布:Prefill-heavy 输入 1,259、输出上限 128;Decode-heavy 输入 199、输出上限 1,024;ShareGPT 为 500 条真实对话(输入均值约 262/中位约 94、输出上限 180、按 2,048 token 分块),全部带 17 token 系统提示。
定义了所有吞吐、成本、碳数字的负载前提;Prefill-heavy 与 Decode-heavy 的巨大差异正是旧卡长板与短板的分界线。