概述
TINY_SCHILLER 是一个专为小型语言模型设计的德语文学文本语料库,填补了德语文学文本在原型开发、微调、教育和研究方面的空白。它提供了一个与 Karpathy 的 tiny_shakespeare 相对应的单文件解决方案。
语料库特点
- 大小:2.07 兆字节,包含十一部公共领域的席勒戏剧。
- 数据来源:来自 DraCor 的 GerDraCor 导出(CC0),并经过确定性解析器工程处理。
- 编码方式:使用字符级、GPT-2 字节对编码和 cl100k_base 令牌化分割。
- 特性:包括指令格式的对话补全分割和 89 个按角色的人物分割。
代码示例
通过 HuggingFace 的一次调用即可加载该语料库,支持如下代码:
// 加载小型语言模型的德语文学文本
model.load("tiny_schiller");
这一设计使得小型语言模型能够以极简的代码接入德语文学文本,极大地方便了研究和应用。
博主点评: TINY_SCHILLER 的推出不仅简化了德语文学文本的获取,还为小型语言模型的应用提供了极大的便利。其一行代码的加载特性,展现了现代 NLP 领域的高效与便捷,值得关注。