网易首页 > 网易号 > 正文 申请入驻

苹果全新语言模型实现超快速长文本生成

0
分享至


苹果发布新型流匹配模型实现文本快速生成

要理解这项研究,首先需要了解几种不同的模型类型。ChatGPT等大语言模型属于自回归模型,它们按顺序生成文本,一次生成一个Token,同时考虑用户提示和之前生成的所有Token。

与自回归模型不同,扩散模型可以并行生成多个Token,并通过多次迭代步骤进行优化,直到形成完整的响应。

流匹配模型是扩散模型的一种变体,它基本上跳过了扩散模型的迭代过程,学会一次性生成最终结果。

苹果和俄亥俄州立大学的研究人员在今天发表的一项研究中,提出了一种名为"少步离散流匹配"(Few-Step Discrete Flow-Matching,简称FS-DFM)的新模型。

研究显示,FS-DFM能够仅通过8轮快速优化就写出完整的文章段落,达到了需要超过一千步才能实现类似效果的扩散模型的质量水平。

为了实现这一目标,研究人员采用了一种有趣的三步方法:首先,训练模型处理不同的优化迭代预算;然后,使用指导"教师"模型帮助它在每次迭代中进行更大、更准确的更新,而不会"过度修正"预期文本;最后,调整每次迭代的工作方式,使模型能够以更少、更稳定的步骤达到最终结果。

与更大的扩散模型相比,FS-DFM在两个重要指标上表现出色:困惑度和熵值。

困惑度分数是语言模型文本质量的标准指标。困惑度越低,文本听起来越准确和自然。

至于熵值,它本质上衡量模型选择每个词的置信度。在实践中,如果熵值太低,文本可能变得重复或可预测;但如果太高,文本可能开始听起来随机或不连贯。

与拥有70亿参数的Dream扩散模型和拥有80亿参数的LLaDA扩散模型相比,参数分别为17亿、13亿和1.7亿的FS-DFM变体在所有迭代次数下都持续实现了更低的困惑度并保持了更稳定的熵值。

鉴于这些结果和该方法显示的前景,以及缺乏类似的模型和研究,研究人员还表示他们"计划发布代码和模型检查点,以促进可重现性和进一步研究"。

如果您想深入了解苹果的方法和模型的更多具体实现细节,请务必查看arXiv上的完整论文。该论文包含多个性能示例,例如用颜色编码显示每个词最后更改的迭代轮次。

论文显示,许多Token被标记为黄色,表明它们在过程早期就被预测出来。这是由于累积标量的作用。

Q&A

Q1:FS-DFM模型与传统大语言模型有什么区别?

A:FS-DFM是一种流匹配模型,与ChatGPT等自回归模型不同。自回归模型按顺序生成文本,一次生成一个Token,而FS-DFM可以并行生成多个Token,并通过少量迭代步骤进行优化,仅需8轮快速优化就能写出完整文章。

Q2:FS-DFM在性能上有什么优势?

A:与拥有70亿和80亿参数的大型扩散模型相比,参数更少的FS-DFM变体(17亿、13亿和1.7亿参数)在困惑度和熵值两个重要指标上都表现更好,实现了更低的困惑度和更稳定的熵值,生成的文本更准确自然。

Q3:困惑度和熵值在语言模型中代表什么意思?

A:困惑度是衡量语言模型文本质量的标准指标,困惑度越低,文本越准确自然。熵值衡量模型选择每个词的置信度,熵值太低文本会重复可预测,太高则会显得随机不连贯,需要保持适当平衡。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
离开皇马是对的!9次过人帮助球队致胜,想去世界杯的他机会来了

离开皇马是对的!9次过人帮助球队致胜,想去世界杯的他机会来了

里芃芃体育
2026-01-24 03:00:03
萧美娘乳白写真合集(2)

萧美娘乳白写真合集(2)

情感大头说说
2026-01-24 15:26:40
伊朗官员:伊朗军队已做好应对最坏情况的准备

伊朗官员:伊朗军队已做好应对最坏情况的准备

环球网资讯
2026-01-24 11:06:18
粤晋大战支离破碎,双方冲突不断,杜锋迪亚洛技犯,徐杰伤退

粤晋大战支离破碎,双方冲突不断,杜锋迪亚洛技犯,徐杰伤退

邹维体育
2026-01-24 21:20:36
后悔了吗?本能成球队名宿,却坚持要转会,如今被告知即将离队!

后悔了吗?本能成球队名宿,却坚持要转会,如今被告知即将离队!

篮球圈里的那些事
2026-01-24 20:29:54
万万没想到,全球局势中“最乱”的竟是中国

万万没想到,全球局势中“最乱”的竟是中国

安安说
2026-01-23 09:12:29
这套黑色打扮又酷又显身材,女人味十足

这套黑色打扮又酷又显身材,女人味十足

美女穿搭分享
2026-01-23 20:29:50
郭富城大房:掌管郭富城20亿身家,却30年没有名分,甘愿为郭带娃

郭富城大房:掌管郭富城20亿身家,却30年没有名分,甘愿为郭带娃

玥来玥好讲故事
2025-12-27 17:01:58
汽车研发谭少锋去世,年仅32岁,遗言:告别式放周末,不耽误时间

汽车研发谭少锋去世,年仅32岁,遗言:告别式放周末,不耽误时间

天天热点见闻
2026-01-24 07:46:33
中方已做好最坏打算!南海发生激烈对峙,黄岩岛突现072登陆舰队

中方已做好最坏打算!南海发生激烈对峙,黄岩岛突现072登陆舰队

老范谈史
2026-01-22 01:41:37
纪实:退伍军人摆摊刺死城管被判死刑,律师的三连问,让法官改判

纪实:退伍军人摆摊刺死城管被判死刑,律师的三连问,让法官改判

五元讲堂
2024-10-30 12:29:40
新一轮雨雪天气即将抵达湖北

新一轮雨雪天气即将抵达湖北

环球网资讯
2026-01-24 14:39:07
残暴,国米让2追6拒绝丢分!大胜难掩两短板,保下限冲上限都难!

残暴,国米让2追6拒绝丢分!大胜难掩两短板,保下限冲上限都难!

肥强侃球
2026-01-24 21:07:54
不许报复美国,美方话音刚落,欧盟作出决定,将逐步淘汰中国制造

不许报复美国,美方话音刚落,欧盟作出决定,将逐步淘汰中国制造

兴史兴谈
2026-01-23 14:03:11
有人预测:明后年,二三十层电梯房,或将面临这3个结局,太真实

有人预测:明后年,二三十层电梯房,或将面临这3个结局,太真实

平说财经
2026-01-24 00:03:37
美军8艘战舰携812枚战斧导弹压境,伊朗:支持美以者必遭打击

美军8艘战舰携812枚战斧导弹压境,伊朗:支持美以者必遭打击

老马拉车莫少装
2026-01-24 00:08:32
马斯克一语成真 全球抢购的不是芯片 而是中国20万一台变压器

马斯克一语成真 全球抢购的不是芯片 而是中国20万一台变压器

阅识
2026-01-21 16:58:32
“喝下就任你摆布”!祸害女性的“听话水”有多可怕?一定要警惕

“喝下就任你摆布”!祸害女性的“听话水”有多可怕?一定要警惕

云端小院
2025-11-11 08:55:33
2球星伤情更新!粤记透露徐杰崴脚无大碍,京记曝赵睿赴医院检查

2球星伤情更新!粤记透露徐杰崴脚无大碍,京记曝赵睿赴医院检查

篮球资讯达人
2026-01-24 22:54:33
退市!300391,被重罚

退市!300391,被重罚

中国基金报
2026-01-24 12:11:42
2026-01-24 23:55:00
至顶头条 incentive-icons
至顶头条
记录和推动数字化创新
15659文章数 49687关注度
往期回顾 全部

科技要闻

黄仁勋现身上海菜市场

头条要闻

张又侠、刘振立被查 解放军报发布社论

头条要闻

张又侠、刘振立被查 解放军报发布社论

体育要闻

当家球星打替补,他们在故意摆烂?

娱乐要闻

回归还是顶流 凤凰传奇将现身马年春晚

财经要闻

“百年老字号”张小泉遭60亿债务压顶

汽车要闻

有增程和纯电版可选 日产NX8或于3-4月间上市

态度原创

数码
本地
时尚
教育
公开课

数码要闻

酷态科6号Ultra充电器曝光:双Type-C接口均支持100W快充

本地新闻

云游中国|格尔木的四季朋友圈,张张值得你点赞

冬天最佳“显瘦”公式:上短+下长

教育要闻

高考地理中的赛事经济

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版