zhuzilin's Blog

about

5.2 的一些总结

date: 2026-06-20
tags: 随感  

虽然发布之前就知道 glm 5.2 这个模型很好,但是没想到事态逐步发展到 another deepseek r1 moment 的状态,深感荣幸。glm 5.2 的训练过程也是我结束了一些非技术的摸索,再次达到 inner peace 的过程,在这里记录一些结论。

  1. 优秀模型的开发需要小团队,拉更多人进来只可能让事情变慢;
  2. 后训练和预训练是不同的学科,从算法到 infra 都是,两者的经验不那么容易相互借鉴;
  3. 大模型时代的后训练开发不存在发版,dev 直出才是版本答案。

感觉可能会有一些泄密因素,就不展开了。