英特尔TDX机密环境下NVIDIA H100 GPU推理性能实测:机密计算代价几何?
随着AI推理工作负载处理敏感数据或保护专有模型的需求日益增长,机密计算已成为实际部署的重要要求。然而,在GPU加速的大语言模型服务中启用机密执行带来的性能成本仍因工作负载而异,且对运营至关重要。
近日,研究人员在arXiv发布了一项基准研究,比较了在英特尔TDX机密实例中单块NVIDIA H100 80GB GPU上标准非机密执行与机密计算模式的性能差异。研究选取了Mistral-7B v0.1和Qwen3-30B-A3B两个代表性语言模型,测量了首令牌时间、端到端请求延迟、每请求令牌生成吞吐量、全局令牌吞吐量以及并发增加时的闭环请求吞吐量。
实验结果显示,在固定请求速率下,机密模式使Mistral-7B的平均首令牌时间增加21.8%,Qwen3-30B-A3B增加27.8%;全局令牌吞吐量分别下降17.7%和21.1%。在闭环并发实验中,吞吐量差距保持在11.5-20.2%范围内,但较大模型在机密模式下更早达到饱和点。
研究表明,机密GPU推理在负载下仍能保持可用吞吐量,但容量规划必须同时考虑稳态吞吐量惩罚和较大模型观察到的早期饱和行为。这些发现为企业在安全与性能之间做出权衡决策提供了重要参考。