反观国内,多数厂家还在旧的红海路线里跟进。
猛灌通用指令微调,卷参数规模,刷榜单的分数,卷b端落地商业化。
报告也多半集中在分布式训练的通信优化或者显存切分等工程trick上。
不过……
当然也是不是全,也有一些国内团队搞出了一些不一样的东西。
有两篇做长序列高效kv cache稀疏化的,还有一篇用大模型反向生成高质量合成数据做自我蒸馏的,思路一样惊艳,台下举手要论文源码的人一样很多。
更有意思的是开源基座这条路。
国外顶尖名校的博士生们如今跑消融实验,底层模型十有八九加载的都是华夏的开源权重,调用便宜,对齐做得好,魔改接口还很开放。
这一条生态护城河上,反倒是国内走在了前列。
……
本章已完成!