摘要
在个人笔记本电脑上,设备端研究代理搜索语料库、阅读来源并撰写引用简报。本文探讨了其引用的忠实度及其成本,针对一个4B生成模型在24GB的笔记本电脑上的表现进行了研究。
本研究将引用声明的忠实度与可信覆盖度分开考量。引用声明的忠实度关注引用来源是否支持该声明,而可信覆盖度则关注代理是否引用了正确的来源。研究比较了生成模型对不同量的来源内容的接触,即400个字符与1500个字符,以及所提供来源的质量,包括黄金论文与检索论文。
结果显示,曝光度影响忠实度。对每个来源的接触量增加,使得检索来源的忠实度从0.45提升至0.58,而黄金来源的忠实度也从0.37提升至0.58。这表明忠实度受曝光度的限制,而非来源的正确性。曝光度提升在独立评审者的判断下也表现出稳健性;在主要评审者下的确切收敛性较紧,而在第二评审者下则仅为近似。
检索效果影响覆盖度。可信覆盖度在任何曝光下对检索来源保持在0.22附近,因为召回率维持在0.40左右,因此曝光度无法改善所引用的来源。额外的曝光成本约为235个输出标记。实践建议是首先提高每个来源的曝光量,以较低的成本进行,然后将检索召回率作为唯一剩余的调节因素。
博主点评: 这项研究深入探讨了在设备端生成模型的引用忠实度与覆盖度的关系,强调了曝光度对结果的关键影响,提供了重要的实践指导,值得关注与借鉴。