在微调Qwen3-Omni-30B-A3B-Instruct模型时,我们原计划用12小时GPU预算跑完1624步训练;但在第1000步时预算耗尽,训练被迫中断。当时损失仍在下降,完整的检查点、优化器状态和调度器都已安全保存在私有云存储中,所以重启没有技术障碍。真正的变化来自完成训练本身。 重启并跑完全程后,60探针文本知识评估的成绩提升了5个百分点(在相同堆栈上重复测试,结果差异为0个百分点);广播音频评测得分也几乎翻倍。两个指标指向同一结论:把训练计划执行到第162
![]()
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.