一篇题为《Do LLMs Capture the Diversity in their Training Data?》的论文发现,大语言模型(LLM)的输出多样性明显低于其训练数据。研究者通过比较模型与训练数据在同一前缀下的条件熵,得出了这一结论。
模型输出更“单调”
![]()
论文对比了OLMo、Pythia、GPT-Neo等模型,结果显示它们的输出条件多样性均低于训练数据。图像生成器也存在类似的差距。以OLMo在20K样本上的表现为例,训练数据得分338.58,而贪心解码仅218.88,nucleus采样为287.31,ancestral采样为297.31。
调高温度有代价
研究者尝试将温度调高至T=1.9,虽然匹配了训练熵,但精度和外部条件NLL(负对数似然)变差。这意味着,简单调参并不能完美解决多样性不足的问题,模型在多样性与准确性之间仍需权衡。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.