Tether 发布 191B token 的 Genesis III 训练数据集:不造更大的模型,专教小模型"讲道理"
2026年9月24日1 次阅读
大语言模型动态 · 2026-09-23
1914 亿 token 的 STEM 合成语料,让 1.7B 的小模型也能把科学问题解释清楚,论文已被 COLM 2026 接收
一句话总结:9 月 23 日,Tether AI Research 正式发布 QVAC Genesis III——191.43B token 的 STEM 合成训练数据集。它不追求更大的模型,而是用两种"教推理"的造数方法,让小尺寸模型学会解释为什么、错在哪,为本地运行的 AI 助教和技术助手铺路。
这是什么
Genesis III 是 Tether QVAC Genesis 系列数据集的第三代(前两代分别于 2025 年 10 月和 12 月发布),这一次规模扩大到 191.43B token、1.596 亿份文档,横跨高中、大学到职业级的 19 个 STEM 学科:生物、化学、物理、数学、计算机、医学、天文、电气工程、统计、机器学习等。论文已被语言模型学术会议 COLM 2026 接收。
为什么重要
现在 AI 圈的主流打法是把模型越做越大,但大模型意味着每次提问都要把请求送到云端。Genesis III 走的是另一条路:不加大模型,而是改进"模型学什么"。小模型算力需求低,可以直接跑在笔记本、手机甚至本地服务器上。
数据集的目标场景很明确——本地运行的 AI 助教和技术助手:给学生讲物理题时,能指出哪一步推理错了、为什么错;对重视隐私或网络条件有限的学校、社区,不用持续把问题发到云端也能用。
两种"教推理"的造数方法
| 方法 | 怎么做 | 效果 |
|---|---|---|
| Failure Analysis(失败分析) | 让更强的"教师"模型分析小模型的错误答案,找出推理在哪一步跑偏、背后是什么误解,再把正确解法生成成新的训练材料 | 错题本身变成了教材 |
| Option-Level Reasoning(选项级推理) | 对答对的题也不放过——不仅解释为什么选 A,还解释为什么 B、C、D 不对 | 模型学会识别错误推理并自我纠正 |
效果怎么样
- 用 Genesis III 的 Option-Level 数据训练的 1.7B 参数小模型,在基准测试中 99.45% 的回答是有效答案。
- 用完整语料训练的模型,在科学和 STEM 推理基准上明显超过用其他开源训练数据集训练的基线。
- 对比知名开源数据集 Cosmopedia-v2,Genesis III 在 Qwen、Llama、SmolLM、Gemma 多种架构上都占优。
对谁有用
- 模型训练者:一套现成的高质量 STEM 推理语料,可以用来做小模型的继续训练。
- 教育产品开发:本地可跑的 AI 助教,适合学校、弱网或隐私敏感场景。
- 端侧 AI 从业者:又一个"小模型 + 好数据"路线的实证案例。
来源: Tether 官方新闻(2026-09-23):Tether Releases Genesis III to Train AI to Explain, Not Just Answer, STEM Problems
— 大语言模型动态 · 每日速递