← 返回 2026-08-18

垃圾场集群:用60美元二手GPU运行LLaMA-70B推理服务 DumpsterCluster: From Dumpster Diving to Serving LLaMA-70B on $60 GPUs

Zeyu Cao, Xuan Guo, Cheng Zhang, Cheuk Hang Lau, Ilia Shumailov, Yiren Zhao 📅 2026-07-10 👍 4 2026-08-23 18:30
LLM推理服务 TCO与碳足迹分析 二手GPU 可持续计算 流水线并行

二手V100组建128卡集群,靠流水线优先并行低成本跑LLM推理,但碳可行性取决于绿电。

前置知识

张量并行(TP)与流水线并行(PP)

张量并行把单个层的权重矩阵按列/行切分到多张卡上,每层前向都需要 scatter/gather 或 all-reduce 通信;流水线并行则把模型按层切成若干阶段,每张卡(或每组卡)完整持有连续若干层,多个请求微批以流水线方式填满各阶段,跨卡只在阶段边界传一次激活。vLLM、SGLang 等主流推理系统的默认启发式是节点内先做张量并行、再向跨节点扩展流水线/序列并行,即 TP-first。

本文核心主张就是反转这一默认顺序:旧卡应该采用设备级流水线优先(PP-first),每卡完整承载一层。不理解两种并行的通信模式差异,就无法理解整个方法设计。

访存受限与 compute-to-bandwidth 比率

按 Roofline 模型,当硬件算力(TFLOPs/s)与显存带宽(GB/s)之比较大时,性能受带宽限制(访存受限),此时聚合更多卡的 HBM 带宽能加速解码;比率较小时则受算力限制。LLM 解码阶段通常访存受限,H100/B200 的比率约 0.28-0.29 TFLOPs/GB,而 V100 只有 0.13 TFLOPs/GB——它带宽相对充裕,瓶颈在算力、显存容量和卡间互联。

这是论文论证『为什么 vLLM 的 TP-first 策略在新卡上合理、在 V100 上反而次优』的定量核心,也是 PP-first 设计的第一性原理(Table 1 的关键行)。

隐含碳(embodied carbon)与运行碳(operational carbon)

隐含碳 $C_{em}$ 是制造硬件产生的碳排放,本文按 $C_{em} = C_{die} + C_{VRAM} + C_{periph}$ 估算:逻辑裸片面积乘以单位面积碳强度,加上 HBM 容量乘以单位容量碳强度,再加上每台服务器约 150 kg CO2e 的外设碳;运行碳 $C_{opt}$ 是使用期电力消耗的碳排放,$C_{opt} = E_{DC} \times I$(能耗乘电网碳强度)。两者加总为 $C_{total}$,再按生成的 token 数归一化。

二手 GPU 的全部环境论证都建立在这对概念上:复用摊薄了隐含碳,但旧芯片低能效抬高了运行碳,最终结论取决于两者之和在哪种电网下更小。

电网碳强度与 PUE

碳强度 $I$(gCO2/kWh)衡量每度电对应的二氧化碳排放,由电网能源结构决定:本文取美国约 20% 可再生(393 gCO2/kWh)、中国约 30%(584)、巴西约 90%(97)、中国风电约 100%(约 10,即全绿电仍保留基础设施生命周期残余排放)。PUE(电能使用效率)是数据中心总能耗与 IT 设备能耗之比,本文统一取 1.2,把服务器功耗换算为整站能耗 $E_{DC} = E_{server} \times PUE$。

论文『旧卡必须与低碳电力战略性耦合部署』这一核心结论完全由这两个参数驱动,理解它们才能读懂四电网、三摊销期的敏感性分析。

TPS 与 TCO(USD per million tokens)

TPS(Tokens Per Second)是推理服务的解码吞吐,直接决定用户体验和按 token 计费 API 的收入上限;TCO 分析把资本开支(买硬件)与运营开支(电费)在 3/5/8 年部署周期上摊销,统一换算成 USD/MT(每生成一百万 token 的美元成本),使不同硬件、不同电价、不同模型规模可以放在同一张表上比较。

全文所有实验表(Table 2、3、6-9)都以 TPS、USD/MT、gCO2/MT 为坐标轴,是评估『DumpsterCluster 到底划不划算』的度量衡。

研究动机

AI 数据中心的快速迭代制造了大规模『功能性退役』:仅 2023 年 NVIDIA 就向数据中心出货超过 300 万颗 GPU 芯片,而数据中心 GPU 通常约 3 年(与保修期对齐)就被新一代产品替换,每个周期都有数百万张仍完全可用的卡流入二手市场。与此同时,一套 8 卡 B200 系统标价约 60 万美元,把最先进的 AI 基础设施挡在多数研究者和中小机构门外;先进 GPU 产能集中在极少数厂商与代工厂,紧缺期采购延迟长达 6-12 个月甚至拿不到配额;持续制造新加速器还带来大量制造阶段隐含碳和电子垃圾。可负担性、供应链安全、环境可持续三条压力线共同指向一个未被认真检验的问题:这些『被丢弃』但仍有算力的卡,能否被重新组织起来服务现代 LLM 推理。

本文的目标是本文的目标是用真实的工程实践而非纸面估计来回答:退役 GPU 组成的『DumpsterCluster』能否以有竞争力的吞吐服务 LLaMA-70B 级别的现代大模型推理,并系统刻画它在什么条件下经济上划算、环境上真正可持续。具体拆成三件事:(1) 从零搭建一个完全使用二手件——GPU、主板、CPU、内存、网卡全部二手——的 128 卡 V100 集群,并实际运营一年;(2) 开发针对性的推理引擎,克服旧卡显存小(16GB)、带宽低(900 GB/s)、互联慢(300 GB/s NVLink)的三大约束;(3) 用统一的 TCO 与碳足迹框架,结合二手市场价格衰减曲线和四个地区的电网数据,给出『何时该部署旧卡、何时不该』的量化决策依据。

与已有工作不同的是,已有工作要么在新硬件上做推理系统优化(vLLM、SGLang),要么在纸面上做数据中心碳核算,两条线很少交叉;对二手 GPU 的讨论多停留在报价观察。本文的独特切入是『先真的建、再认真算』:作者实打实用批量价 60 美元的二手 V100(比 B200 便宜百倍以上)组装 128 卡集群,运营 12 个月并记录全部 58 起故障事件;软件上提出主流系统没有的设备级流水线优先并行加 CPU 异步通信的组合;分析上首次把拉伸指数价格衰减模型、两种碳核算口径(extended/zero embodied)与四个地区电网统一进同一张决策表,最终给出『GPU 第二生命并非普适可持续,必须与低成本低碳电力战略性耦合』这一有条件、可操作的结论。

核心方法

直觉上,单张 V100 的短板——16GB 显存装不下 70B 模型、900 GB/s 带宽只有 H100 的 27%、NVLink 300 GB/s 只有 H100 的三分之一——都是『单卡视角』的问题;用 128 张卡横向扩展并改变模型切分方式即可绕开。技术路线分四层:(1) 硬件层:16 台 8 卡 V100 SXM 服务器组成一个 pod,NVLink 只在每 4 卡一组内有效,跨节点走 100G RDMA,整套 2024 年约 3.2 万美元、2026 年 3 月已跌到约 2.2 万美元;(2) 并行层:自研 Rust 推理引擎采用设备级流水线优先策略,每卡至少完整承载一层,LLaMA-70B 被切成最多 80 个流水线阶段;(3) 通信层:所有跨卡数据传输由 CPU 异步预取完成,与 GPU 计算重叠以隐藏延迟;(4) 分析层:以 $C_{total} = C_{opt} + C_{em}$ 和 USD/MT 为度量,在三类负载、两个模型规模、四种电网上做经济性与碳足迹敏感性分析。

核心创新是把『选哪种并行』还原为硬件的 compute-to-bandwidth 比率问题。H100/B200 的算力带宽比约 0.28-0.29 TFLOPs/GB,解码高度访存受限,所以 vLLM 等系统 TP-first、用张量切分聚合 HBM 带宽是正确设计;V100 比率只有 0.13 TFLOPs/GB,带宽相对充裕而算力、显存容量、卡间互联才是瓶颈,此时 TP 的 scatter-gather 通信纯属浪费——正确做法是把整层放进一张卡、按层切出最深的流水线(LLaMA-70B 达 80 级),跨卡只需传层输出,带宽需求仅 3.125 GB/s,远低于集群互联能力。第二个关键设计是通信宿主从 GPU 迁移到 CPU:朴素流水线让 GPU 自己调 NCCL 收发,kernel launch 会阻塞两端 GPU 造成流水线气泡;本文让 CPU 异步管理全部跨卡传输,GPU 计算第 $t$ 步时 CPU 已预取第 $t+1$ 步输入,把通信时间完全隐藏在计算之下。这两点的组合在商品化服务系统中并不存在。

方法步骤详情

完整流程如下。(1) 采购与分箱:2024 年 5 月以 215 美元/卡、7 月以 170 美元/卡购入二手 V100(现价 50-60 美元),对 GPU、CPU、主板全部压力测试分箱,剔除到货即坏与易早衰个体。(2) 组装:每台服务器含 2 块 SXM 底板共 8 张 V100,底板上两个 PCIe 3.0 switch 各连 2 张 100G ConnectX-5 网卡;计算板为双路 Xeon 6138 加 256GB DRAM;4 张网卡上联 100Gbps RDMA fabric,另配 25Gbps 管理口;16 台服务器组成一个 128 卡 pod,作者共部署两个。(3) 并行规划:模型按层切分、每卡至少一层,70B 最多 80 级流水线,可在最后阶段叠加张量并行。(4) 运行时:请求组成连续批次沿流水线流动,CPU 在 GPU 算第 $t$ 步时异步预取并发送第 $t+1$ 步激活。(5) 运维:额外部署 10% 冗余 GPU 并做负载均衡。(6) 评测:在 Prefill-heavy(输入 1,259/输出 128)、Decode-heavy(199/1,024)、ShareGPT(500 条真实对话)三类负载下,测 LLaMA 3.1-8B/70B 的 TPS、四电网 USD/MT、3/5/8 年 TCO 与 gCO2/MT,基线为 vLLM 上的 B200/H100/A100。

技术新颖性

新颖性有四层。(1) 实证对象新:首个全二手件(含主板、CPU、内存、网卡)从零搭建并公开一年真实运营数据(含逐条故障记录)的 LLM 推理集群研究,此前无人给出旧卡跑 SOTA 模型的实测吞吐。(2) 系统设计新:设备级(而非业界常见的 4-8 卡节点级)流水线,深度达 80 级,配合 CPU 侧异步通信消除 NCCL 气泡;论文还给出反转 vLLM/SGLang TP-first 默认顺序的定量依据(compute-to-BW 比率 0.13 对 0.29)。(3) 建模工具新:用拉伸指数衰减 $P(t) = P_0 \cdot e^{-(t/\tau)^\beta}$ 拟合二手价曲线,发现 $\beta > 1$ 的加速贬值规律(V100 $\tau$=48.3 月、$\beta$=2.43,$R^2$=1.000;A100 61.7 月、4.66)。(4) 会计口径新:对复用硬件同时报告 extended(隐含碳摊到第二生命并乘 1.1 冗余系数)与 zero embodied(视为免于填埋、隐含碳记零)两个边界口径,避免单一核算框架的立场偏倚。

An illustration and real pictures of our used GPU pod configuration
Figure 3: An illustration and real pictures of our used GPU pod configuration
An illustration of the model parallelism strategy described with our approach
Figure 4: An illustration of the model parallelism strategy described with our approach
An illustration of our pipelining compared to a naive pipelining strategy in a 4 GPU setting for inference
Figure 5: An illustration of our pipelining compared to a naive pipelining strategy in a 4 GPU setting for inference

实验结果

逐项看实验。(1) 8B Prefill-heavy:128 卡 V100 达 223,936 TPS,反超单卡 B200 的 62,651 TPS(3.6 倍),GPU 开支仅 $7.68K 对 $75K,TPS/$ 为 29.16 对 0.84(约 35 倍)。(2) 8B ShareGPT:21,504 对 43,911 TPS,吞吐一半但 TPS/$ 约 4.8 倍。(3) 8B Decode-heavy:8,128 对 26,037 TPS,解码负载是旧卡短板(4 卡 pod 仅 254 TPS)。(4) 70B Prefill-heavy:1,512 TPS,约为 8 卡 B200(37,045)的 1/25,但资本开支低 78 倍,TPS/$ 约 3.2 倍于 B200;单张 16GB V100 装不下 70B,全靠 80 级流水线才『能跑』。(5) 扩展性:70B 从 16 卡 189 到 128 卡 1,512 TPS,8 倍设备换 8 倍吞吐,严格线性;8B 4 卡到 128 卡亦随 32 倍设备数近线性增长。(6) TCO:中国电价下 8B 五年期 V100 $0.0007/MT 对 H100 $0.0042,最多 6 倍优势;70B 下 V100 三年期成本反为 H100 的 1.5 倍(67% 成本效率);作者指出二手 A100 80GB 方案多年期口径下反而最具成本效益。(7) 碳:电网平均碳强度下 V100 碳足迹 8B 约 3.7 倍、70B 约 41 倍;全风电下 8B Prefill 降至 0.31/0.11 对 0.07 gCO2/MT。(8) 可靠性:一年 58 起事件仅 8 起真硬件故障(年化设备故障率 6.25%),与 10% 冗余吻合。(9) 商业对照:Together AI 定价 8B/70B 为 0.10/0.88 USD/MT,旧卡方案仍有可观利润。

Hardware characterization and embodied carbon for GPUs
Table 1: Hardware characterization and embodied carbon for GPUs
Prefill-heavy workload, LLaMA 3.1-8B
Table 2: Prefill-heavy workload, LLaMA 3.1-8B
Prefill-heavy workload, LLaMA 3.1-70B
Table 3: Prefill-heavy workload, LLaMA 3.1-70B
Decode-heavy workload, LLaMA3.1-8B
Table 6: Decode-heavy workload, LLaMA3.1-8B
Decode-heavy workload, LLaMA 3.1-70B
Table 7: Decode-heavy workload, LLaMA 3.1-70B
ShareGPT workload, LLaMA 3.1-8B
Table 8: ShareGPT workload, LLaMA 3.1-8B
ShareGPT workload, LLaMA 3.1-70B
Table 9: ShareGPT workload, LLaMA 3.1-70B
Energy supply configurations used in the carbon analysis
Table 10: Energy supply configurations used in the carbon analysis
Tokens per Second (TPS) for B200, H100, A100, and V100 devices evaluated across various workloads
Figure 2: Tokens per Second (TPS) for B200, H100, A100, and V100 devices evaluated across various workloads
Total cost of ownership (USD per million tokens) across four energy mixes and deployment lifetimes of 3, 5, and 8 years
Figure 6: Total cost of ownership (USD per million tokens) across four energy mixes and deployment lifetimes of 3, 5, and 8 years
查看结构化数据
任务指标本文基线提升
LLaMA 3.1-8B Prefill-heavy 推理吞吐 TPS (tokens/s) 128×V100:223,936(16×V100 规模下约 29.16 TPS/$) 1×B200(vLLM v0.17):62,651;1×H100:29,343;1×A100 80GB:12,451 吞吐为 B200 的 3.6 倍,GPU 资本开支低约 10 倍($7.68K vs $75K),TPS/$ 约 35 倍(29.16 vs 0.84)
LLaMA 3.1-8B ShareGPT 真实对话负载 TPS 128×V100:21,504 1×B200:43,911;1×H100:9,312 绝对吞吐约为 B200 的一半,但按 TPS/$ 计约 4.8 倍(2.80 vs 0.59)
LLaMA 3.1-8B Decode-heavy 负载 TPS 128×V100:8,128(4×V100 pod 仅 254) 1×B200:26,037;1×H100:11,506 绝对吞吐约 0.31 倍,解码类负载是旧卡短板,反映深流水线对自回归串行生成的局限
LLaMA 3.1-70B Prefill-heavy 推理吞吐 TPS 128×V100:1,512(16×V100 仅 189) 8×B200:37,045;8×H100:19,885;8×A100 80GB:8,642 绝对吞吐约 1/25,但资本开支低 78 倍($7.68K vs $600K),TPS/$ 约 3.2 倍于 B200 系统
LLaMA 3.1-70B Decode-heavy 负载 TPS 128×V100:2,536 8×B200:24,695;8×H100:10,372 绝对吞吐约 0.1 倍;16 卡 pod 仅 317 TPS,说明深流水线是该规模下的必需而非可选
三年 TCO(中国电网,约 30% 可再生) USD/MT 8B:0.0008;70B:0.12 8B:B200/H100/A100 均约 0.01;70B:H100 0.08、B200 0.17 8B 成本约为新卡方案的 1/6 至 1/12;70B 则反转为 H100 的 1.5 倍(67% 成本效率),规模越大优势越小
碳足迹(电网平均碳强度,中国约 30% 可再生) gCO2/MT 8B:6.85/6.65(extended/zero embodied);70B:1,014.91/985.40 8B:B200 1.84、H100 2.82;70B:B200 24.62、H100 32.74 碳劣势:8B 约 3.7 倍、70B 约 41 倍——化石能源主导电网下旧卡显著增碳
碳足迹(100% 中国风电) gCO2/MT 8B Prefill:0.31/0.11;70B Prefill:46.45/16.93 8B:B200 0.07;70B:B200 0.61 绿电下差距大幅收窄,8B zero-embodied 口径(0.11 vs 0.07)已接近持平;70B 仍有约 27 倍差距
128 卡 V100 集群一年实运可靠性 故障事件与年化设备故障率 58 起事件:32 次 PCIe 复位(55.2%)、18 次软件复位(31.0%)、5 次 CPU 故障、2 次 NIC 故障、1 次 GPU 故障;年化设备故障率约 6.25% 文献中数据中心 GPU 5 年生存率约 90%(Ostrouchov 等) 真硬件故障仅占 13.8%,86.2% 可软件恢复;分箱加 10% 冗余后可靠性达到生产可用水平
二手市场价格衰减建模 拉伸指数拟合参数与贬值幅度 V100:$\tau$=48.3 个月、$\beta$=2.43($R^2$=1.000);A100:61.7 个月、4.66(0.9997) V100 从发售价 $10,000 跌至 $60;A100 从 $12,000 跌至 $1,900 $\beta > 1$ 表明加速贬值:V100 贬值 99.4%、A100 84.2%,为旧卡集群的超低资本开支提供市场证据

局限与改进

作者承认的局限:(1) 只适用于推理不适用于训练——梯度同步需要高卡间带宽(V100 NVLink 300 对 H100 900 GB/s),大 batch、FP32 精度与数周连续运行会放大旧卡故障率和检查点回滚的重算代价;(2) 环境收益强依赖电网碳强度,化石电网下旧卡『省隐含碳、增运行碳』可能净增排放;(3) 市场悖论——若方案普及推高二手价,论文的经济优势数字会失效;(4) 无厂商保修,需自建硬件诊断与维修能力,运维开销高于新硬件。我补充的观察:(5) 70B 绝对吞吐差距大(1,512 对 37,045 TPS),只适合延迟不敏感的批处理场景,所谓 3.2 倍性价比是按资本开支摊出来的,交互式产品难以接受 10-25 倍的吞吐差;(6) 基线软件栈版本不齐——B200 用 vLLM v0.17、H100/A100 用 v0.65,脚注还出现 v0.6 的矛盾表述,且 Table 9 中 H100/A100 在 ShareGPT 下吞吐(5,265/3,402)异常偏低,基线调优程度存疑;(7) 碳核算排除了回收与填埋的末端排放,B200 隐含碳因数据缺失用最近工艺节点推算(表中带星号),不确定性较大;(8) 缺少单卡 V100 基线(16GB 装不下 70B),部分对比是『128 卡集群对 8 卡 pod』的不对等粒度。

独立分析的弱点

独立分析的弱点与改进方向:(1) 能效鸿沟是工艺级的——V100 的 TSMC 12nm 加 HBM2 决定了每 token 能耗数倍于 H100,软件无法根治;改进方向:为旧卡定制 DVFS/功耗封顶策略,把调度目标从时延改为每 token 能耗。(2) 解码并行度不足:Decode-heavy 下 4 卡 pod 仅 254 TPS、128 卡也只有 8,128 TPS,说明深流水线对自回归解码的串行依赖无能为力;改进方向:prefill/decode 分离部署、用小模型做 speculative decoding、chunked prefill 与更大连续批处理。(3) 可靠性样本单薄:单一集群一年 58 起事件不足以外推故障率,没有季节性、批次差异和磨损曲线分析;改进方向:多站点长周期跟踪,结合 SMART 数据做故障预测,动态调整冗余比例。(4) 碳分析用年均碳强度,未做逐小时粒度;改进方向:碳感知调度,让请求实时流向低碳时段或低碳地区(follow-the-sun)。(5) 经济结论电价敏感:8B 的 6 倍优势高度依赖中国工业电价 $0.0556/kWh,电价上浮、自建制冷或土地成本都会收窄优势;应补充电价-盈亏平衡曲线和 PUE 敏感性分析。

未来方向

作者提出的方向:与可再生电力共址部署,用旧卡消纳本会被弃风弃光的电力;跨能源市场地理多样化部署,对冲能源价格波动与单一电网的政策风险;坚持『推理优先』定位,因为模型只训练一次却要服务数十亿次查询。基于本文成果可延伸:(1) 异构混编集群——新卡做 prefill、旧卡做 decode 的解耦架构,或旧卡跑 draft 模型的投机解码;(2) 量化适配——INT4/AWQ 等低比特量化让 16GB 旧卡装下更大模型,降低流水线深度和通信次数;(3) 碳感知调度器——接入实时电网碳强度 API 做请求级路由与批处理决策;(4) 低带宽训练任务——LoRA/QLoRA 微调对互联带宽要求远低于全参数训练,可能落在旧卡能力圈内;(5) 市场弹性建模——把『采用量推高二手价』的反馈回路引入 TCO 模型,预测方案普及后的价格走势与最佳采购窗口;(6) 软件开源化——把 Rust 引擎的设备级流水线与 CPU 异步通信抽象为可插拔后端贡献回 vLLM/SGLang 生态,让方案 beyond 论文可复用。

复现评估

硬件复现门槛低、路径清晰:所有部件均可在二手市场购得,pod 整机 2024 年约 3.2 万美元、2026 年 3 月约 2.2 万美元(单卡 50-60 美元),论文给出完整拓扑(Figure 3)与型号清单(V100 SXM 底板、双路 Xeon 6138、256GB DRAM、ConnectX-5 100G 网卡、100Gbps RDMA fabric、25Gbps 管理口)。软件是最大障碍:自研 Rust 推理引擎未提及开源,设备级 80 级流水线加 CPU 异步通信属于高工程量的定制开发,完整复刻需要数人月的系统工作。评测协议完全可复现:三类负载的 token 分布(Table 5)、电网价格与碳强度数据源(EIA/CEIC/Ember 2023,Table 4/10)、碳核算全部公式(式 (1)-(10),含 PUE=1.2、外设 150 kg CO2e/服务器、1.1 冗余系数)均已公开;基线方面 B200 用 vLLM v0.17、H100/A100 用 v0.65,版本对齐后数字可能略有出入。总体:结果验证(复测吞吐与成本)中等偏易,系统级复刻中等偏难,算力门槛约 2.2 万美元起,远低于任何新卡方案,适合高校实验室级别的复现。