摘要
机制可解释性(MI)已成为分析和干预推理计算的强大方法,应用范围不断扩大,包括越狱尝试检测、真相评估和幻觉检测等。然而,MI在生产模型服务系统中的部署目前并不实用,因为大多数现有的MI框架引入了过高的运行时开销。根本问题在于MI函数与服务模型的组合不够清晰:它们会导致部署碎片化,常常迫使请求被排空并重建服务状态,同时与生产部署中至关重要的性能优化(如连续批处理和CUDA图执行)发生冲突。
我们提出了xMIx,这是一个面向服务的框架,用于在生产推理服务环境中部署MI应用。xMIx使得可以将MI函数附加到模型运行时的预定义位置,插入到层和残差流中的激活。在前置模型层的输出条件下,xMIx支持MI函数的条件调用。多个MI应用可以在单个模型实例中部署。xMIx将它们全部编译到服务路径中,但仅在运行时必要时动态激活,性能损失微乎其微,无需额外的模型实例或替代执行堆栈。
我们将xMIx与vLLM服务系统集成,并在三种主要模型和七种不同的MI应用中进行了评估。xMIx的性能与原生vLLM执行相当,平均每个token的延迟(ITL)仅增加1.3%,尾部P99 ITL增加1.2%,首次token的平均时间(TTFT)增加2.6%,总token吞吐量(TTT)平均增加1.6%。
博主点评: xMIx的提出有效解决了机制可解释性在生产环境中的应用难题,通过动态激活MI功能,不仅保持了高性能,还提升了模型的可解释性。这对于需要高效推理的实际应用场景具有重要意义,值得关注和进一步研究。