车载助理需要把自然语言请求转化为车辆功能调用,受限于内存和延迟,小语言模型(SLM)适合本地部署。关键设计是函数表面的呈现方式:功能标记(FT)或在提示中直接提供函数模式(SIP)。
FT 为每个函数分配专用标记,推理紧凑,但只能调用训练期间见过的函数;SIP 把函数模式写入提示,能够推广到未见函数,但提示更长,推理开销更高。
我们构建了包含 79 个 Android Automotive 函数、9822 条单轮对话的基准,涵盖已见函数、未见函数以及需要拒绝的请求。
在四种规模的 SLM(270M‑1.7B)上进行匹配微调比较。对已见函数,模型规模提升收益有限,270M 已能匹配 1.7B,最佳整体表现出现在 0.6B。对未见函数,FT 按设计准确率为 0,SIP 能推广且随规模提升显著改善。对超出范围请求,FT 有时会错误调用已学到的不可用函数,而 SIP 更倾向于基于提供的函数列表拒绝。
这种灵活性伴随更高的显存占用和推理时延。理论分析表明,SIP 通过显式模式实现函数概念的泛化,模式长度越长推理成本越高。
结论是函数表面表示方式比单纯扩大模型规模更决定 SLM 在车载函数调用中的能力和失效模式。点评