摘要
本报告研究了在隐私约束下,针对台湾市场的设备端英语到繁体中文的字幕翻译,特别是在输入短、输出短、单批次推理和低延迟的情况下。这些条件限制了针对长上下文或高吞吐量语言模型服务的优化价值。
基于 LMT-60-0.6B 的初步分析表明,在 GGUF 量化后,词汇投影成为解码时更重要的成本,相对于 Transformer 模块的成本有所降低。我们用 64k-token 的字幕领域分词器替换了原始的 151k-token 词汇,迁移了嵌入空间,并通过嵌入校准后进行全监督微调。
在 OpenSubtitles2024 测试集中,LocalSubs 在 GPT-4o 的成对评分下以 59.2% 的不包含平局的胜率超越了 Google Translate。性能在短提示上最强,随着提示长度的增加而下降。
在一次独立的 Apple M2 Metal 性能分析中,LocalSubs 相较于 151k 词汇基线实现了 1.63 倍的速度提升。代码可在 GitHub 上获取。
博主点评: 本文展示了在特定应用场景下,如何通过优化词汇和模型微调来提升实时翻译性能。特别是在低延迟和隐私要求下,探索新的模型架构和优化策略显得尤为重要,值得进一步研究和实践。