MiniMind

基本信息

  • 类型:教学性质的大模型从零训练项目(开源)

  • 卖点是那句话:2 小时完全从 0 训练一个 26M 参数的小 GPT(对比 GPT-3 的 175B,小了约 6700 倍)

  • 开源地址:GitHub xiguiwang/minimind(多个社区 fork)

说人话版:它是干什么的

  • 不是用来做产品的,是用来亲手体验大模型怎么炼成的:普通 GPU 就能跑,把大模型训练的全流程走一遍

训练三步流程

  1. 预训练(学知识):python train_pretrain.py → 输出 pretrain_*.pth
  2. 有监督微调(学对话):python train_full_sft.py → SFT 权重
  3. 部署推理:加载权重开始对话
  • 数据文件有多种搭配方案,按 GPU 资源自由选择;权重每 100 步自动保存

定位提醒

教学 / 学习工具,对视频制作等工作流没有直接帮助;想搞懂「大模型到底怎么训练出来的」,跑一遍就明白。

版本谱系(2026-10-02 核实,原笔记的 26M 已是两代前)

版本规模时间
minimind2 系列26M / 145M两代前
minimind-364M当前主线
minimind-3-moe198M / A64M2026-04-01
minimind-3v / 3v-moe视觉版2026-04
MiniMind-O语音全模态见 arXiv:2605.03937

「2 小时训练 26M」这个卖点的方法论仍然成立,只是现在的最小版本是 64M。引用时写清是哪一代。

官方链接

相关日记