摘要
机密计算正成为处理敏感输入或保护专有模型资产的AI推理工作负载的实际部署要求。然而,启用机密执行的性能成本仍然依赖于工作负载,并具有重要的操作意义。本文展示了一项基准研究,比较了在Intel TDX机密实例中,单个NVIDIA H100 80GB GPU的标准非机密执行与机密计算模式的性能。
实验设置
评估使用两个代表性语言模型:Mistral-7B v0.1和Qwen3-30B-A3B。我们测量了首次令牌生成时间、端到端请求延迟、每请求令牌生成吞吐量、全局令牌吞吐量和在增加并发下的闭环请求吞吐量。
结果分析
在固定请求速率实验中,机密模式下Mistral-7B的平均首次令牌生成时间(TTFT)增加了21.8%,Qwen3-30B-A3B则增加了27.8%;全局令牌吞吐量分别下降了17.7%和21.1%。在闭环并发实验中,吞吐量差距保持在11.5%到20.2%之间,但较大模型在机密模式下更早达到饱和点。这些结果表明,机密GPU推理在负载下仍能保持可用的吞吐量,但容量规划必须考虑稳定吞吐量的惩罚和较大模型提前饱和的现象。
博主点评: 本文通过对比实验揭示了机密计算在GPU推理中的性能影响,强调了在设计AI推理系统时需要考虑的吞吐量损失。随着机密计算的普及,如何在保证安全的同时优化性能将是未来的重要挑战。