mimeo 是一个开源工具,能够自动抓取某位公开专家的作品,逐条核对引用与缓存的原文,并生成可供智能体加载的文件。八次记录的构建平均调用模型 38 次,检查阶段剔除 13.2% 的引用错误。我们使用同一套编码代理框架,对四份专家文件进行评估。
在知识获取方面,mimeo 能完整回答 20 道包含大量引用的冷门问题,而闭卷条件下最多只能答对 10 道。相同页面的 BM25 关键字检索得到 15‑17 道正确答案,二者差距在本样本中尚未消除。
关于语义 grounding,纯模型记忆生成的人格在 20 道答案中有 1‑4 条出现文献记载的立场错误,而普通代理和 mimeo 从未出现此类错误。短提示下人格特征易于辨认,加入任务材料后辨识度下降 18‑23 分。mimeo 的可辨识度与仅凭记忆构建的人格相当。
判断迁移仍未得到明确结论,因为两组测试均已触顶:所有条件在工程任务中找出 94‑97% 的植入问题,在 16 项新应用场景中得分 94‑100%。AI 评审的“像专家”得分随评审模型变化:四位评审中有两位更倾向于模型刻板印象的答案,另外两位则未见差异,提示单一 AI 评审的局限。
综合来看,mimeo 作为一种紧凑且可检查的专家参考资料是可行的,但尚未证明能够转移专家的判断能力。工具与专家档案请见 https://github.com/K-Dense-AI/mimeo
点评