网易首页 > 网易号 > 正文 申请入驻

当27个顶尖语言模型遇上一场没有裁判偏见的烹饪考试

0
分享至


你有没有想过一个问题:如果让ChatGPT给你的晚餐搭配三样食材,它靠谱吗?

更麻烦的是,你要怎么判断它给得对不对?

这个问题看起来很小,但拆开一看全是坑。如果找人类来打分,人和人的口味天差地别,今天张三觉得香菜配牛肉绝了,李四闻到就想吐。如果找另一个AI来当裁判,那问题更大,你怎么知道裁判自己没有偏见,会不会因为某个模型的回答风格更像自己就多给几分?如果用最笨的办法,设一个标准答案去核对,那又会把所有"虽然不是标准答案但也挺合理"的回答直接判为零分,这明显不公平。

这几乎是所有开放式AI测试的通病。写作、聊天、推荐这类任务,评判标准本身就是模糊的,只要有人(或者另一个AI)参与打分,偏见就会像水一样渗透进来。

2026年8月,两位研究者Josef Chen和Erim Hayretci拿出了一个挺聪明的解法,他们做了一个叫FlavourBench的评测系统,核心思路是:不用人也不用AI来当裁判,而是用一套可以被计算机精确执行的"烹饪算法"来打分。

这套算法叫Epicure,它不评判"好不好吃"这种主观感受,而是给出一个客观、可复现、可审计的数字分数。这就好比考试不再靠老师主观判卷,而是像编程题一样,写完代码直接跑测试用例,对不对一目了然。

这篇论文用这套系统测试了27个当下最顶尖的语言模型,从GPT、Gemini、Claude到Grok、DeepSeek、Qwen等等几乎叫得上名字的都在列。最后跑出来一个有统计学意义的排行榜,谁第一谁垫底,甚至哪些模型之间的差距根本没法下定论,都写得清清楚楚。

先搞明白:这事到底难在哪

我们先说说这个领域原本是什么状况。

在这篇论文之前,测试语言模型的开放式能力(也就是没有唯一标准答案的任务),主流做法基本上是三种。

第一种是找人类打分,比如著名的Chatbot Arena,让真人给两个模型的回答投票,谁的回答更好就给谁一票。这个方法很直观,问题是人类评委数量有限,投票量稀疏,而且一千个人可能有一千种口味标准,很难量化成精确的分数差异。

第二种是"以AI为裁判",让一个更强的模型(比如GPT-4)去评判其他模型的回答质量。这个方法能规模化,但引出了一个新麻烦:如果裁判模型本身有某种偏好(比如喜欢啰嗦的回答,或者对自己家族的模型天然有好感),这种偏见会系统性地污染所有排名。论文里提到了2023年郑等人那篇专门讨论"用LLM当裁判"这套方法的偏差和校准问题的研究,说明这个隐患业界早就意识到了。

第三种是死板的精确匹配,比如某些知识问答题,答案要一字不差才算对。这个办法客观是客观了,但代价是它把所有"答案不完全一样但同样合理"的回答全部否定掉,尤其是烹饪这种本来就有多种正确解法的领域,这种打分方式简直是在浪费信息。

那FlavourBench想解决的核心矛盾是什么呢?

它想要的是,既要客观(不受评判者主观偏好影响),又要有区分度(不是非黑即白的对错,而是有连续的分数梯度)。

要同时做到这两点,唯一的办法是找一个可以被穷举、被精确计算的任务空间。这正是Epicure系统能派上用场的地方。

> Epicure:一套把1790种食材放进300维空间的烹饪算法系统,能计算食材之间的相似度、搭配度、饮食限制的可行性等等,输出的是确定性的数值,不受随机性影响

Epicure本身不是这次评测的选手,它是一把标尺。论文作者特别强调,Epicure"不是100%准确",它只是定义了这次任务的奖励标准,衡量的是模型和这套系统之间的一致程度,而不是绝对的、普适的人类口味真理。这个区分很重要,后面会讲到为什么。

任务设计:从8选3,56种组合全部提前打分

具体怎么出题呢?

每道题会给模型看八种食材(比如帕玛森芝士、莳萝、烤南瓜等等),要求从中选出三种组成一个"食材组合"。

这里的巧妙之处在于,八选三一共有56种可能的组合(数学上叫组合数C(8,3)=56)。研究者们在模型做题之前,就已经用Epicure把这56种组合全都算了一遍分数,每一种组合值多少分,都提前锁定好,存进一张"分数地图"里。

等模型给出答案后,系统只需要做一件事:去这张提前算好的地图里查表。

> FINAL_SELECTION:题目要求模型的最终答案必须以这个标记开头,后面跟三个不重复的字母(代表选中的食材),系统只识别这一行,前面模型写多少分析文字都不影响打分

这个设计非常关键,它彻底避免了"AI裁判需要理解回答内容再打分"这种主观环节。整个打分过程变成了纯粹的查表操作,跟裁判有没有偏见毫无关系,因为压根没有裁判在场做判断,只有一张提前算好的表格。

这就好比你参加一场智力竞赛,题目是从8张扑克牌里选3张组成最大的点数组合。出题人在比赛开始前,已经把所有56种选法的点数排列表算好锁进保险箱。你选完之后,工作人员不需要重新计算或判断你选得"好不好",只需要翻开保险箱里对应的那一栏,直接读数字。如果不这样做,而是让一个人现场判断"这个组合是不是比较厉害",那么裁判的心情、经验、甚至当天有没有吃饱饭都可能影响他的判断。提前锁死答案表,就是把主观判断这个环节彻底焊死。

题目分成三大类,论文管它们叫"决策家族"。

第一类叫替代(Substitution),比如给你一种奶酪,让你选三种最能替代它、又互相搭配的食材,主要看的是食材相似度加上组合内部的协调性。

第二类叫搭配(Pairing),比如给你一块甜面包,选三种最适合搭配它的食材,重点考察风味亲和力。

第三类叫约束(Constraints),这类题目加了硬性限制,比如必须是素食、加工程度不能超过某个等级,选错了直接零分,这类题目的分数分布比较极端,因为不满足限制条件的组合会被直接判死。

> NOVA处理等级:一种食品加工程度的分类标准,等级越高代表食品加工程度越深(比如从新鲜土豆到薯片这种深加工零食),约束类题目里常用来卡死不合规的选项

三类题目各出了178道,两个团队各自独立编制了一套题库(互相不知道对方出的题),每套题库89道题,这样就有了两个可以互相验证的"平行考卷"。

参赛名单:27个几乎叫得上名字的顶尖模型

这次拉来参赛的阵容确实豪华,几乎覆盖了当下所有主流的语言模型阵营:OpenAI的GPT-5.6系列(Sol、Terra、Luna)、Anthropic的Claude(Opus、Sonnet、Fable 5)、谷歌的Gemini 3.1 Pro和3.6 Flash、马斯克的xAI旗下Grok 4.6、Meta的Llama 4 Maverick,还有来自中国厂商的Kimi K3、通义千问Qwen系列、智谱GLM系列、DeepSeek V4系列、腾讯混元HY 3等等,一共27家。

有一个细节挺有意思。智谱AI(Z.ai)的GLM 5.3并不是一个常年在线的公开接口,论文作者专门拿到了一份"书面许可",只跑一次有限次数的测试,跑完就关掉,不留一个常驻的后门接口,而且还把这份许可和它的数字指纹一起打包进了公开数据里。这种做法透着一股谨慎劲儿,生怕留下任何"暗箱操作"的空间。

所有模型接受测试时,走的都是提前锁定好的技术路线(论文里叫"路由"),比如通过哪个云服务商、用哪种精度的模型版本,这些全部在测试开始前就写死,中途不许换路子。如果测试过程中某条路线出了故障需要换一条,那么整个模型的所有答案要全部推倒重来,而不是东拼西凑,把之前答对的题目留着,只补跑出问题的那部分。

这有点像马拉松比赛的规则,如果你中途换了一双鞋,裁判不会说"没事,前半程按旧鞋成绩算,后半程按新鞋成绩算",而是要求你重新从起点跑一遍。如果不这么严格要求,一个模型可能在简单路线上先刷一部分高分题,再在困难路线上补剩下的题,成绩单看起来完整,实际上是拼凑出来的,根本没法公平对比。

排行榜是怎么算出来的:534道共同题,一个都不能少

这里有一个特别值得说道的设计,叫"完整共同核心"(complete-core)。

意思是,最终进入排行榜统计的题目,必须是全部27个模型都成功、有效地回答过的题目。如果某道题有一个模型没答(比如接口故障、回答格式不对被判无效),这道题就直接被踢出统计范围,不会给那些答了的模型"送分",也不会给没答的模型记零分。

最终筛出来的题目数量是534道,来自两个题库、三大类别,每个类别每个题库各89道(89乘以3乘以2正好等于534)。这534道题构成了所有27个模型公平对比的统一考卷,每个模型恰好回答了534道有效题,一分不多一分不少。

为什么要死磕这种"完整对齐"?

因为如果不这样处理,排行榜很容易被"选择性统计"污染。想象一下,如果A模型只在简单题上表现好,而它恰好因为技术故障漏答了很多难题,如果直接用它答过的题目算平均分,很可能虚高。反过来B模型硬着头皮把所有难题都答了,可能平均分反而被拉低。这样比出来的名次,根本不是公平较量,而是"谁漏答的题目更有利于自己"的运气比拼。

这就好比两个学生比较期末考试成绩,一个只做了卷子里比较简单的选择题部分,另一个把整张卷子(包括难度更大的大题)都做了,如果只按各自做完的题目部分来算平均分,前者显然占了便宜。而这篇论文的做法相当于,只统计两人都做过的那部分题目,谁做得好就是好,绝不含糊。

论文里管这个筛选规则叫"分数盲选"(score-blind),意思是选题目进不进共同核心,只看"是不是全员都答了、格式对不对",完全不看这道题具体得分是高是低。这就杜绝了"挑简单题给自己刷分"的可能性,因为筛题的时候压根不看分数,只看有没有答。

一个数字不够,还要配上"误差范围"和"两两对比"

单看一个平均分排名,其实信息量是不够的。

论文的做法是,不仅算出每个模型的最终得分(叫FlavourBench Score,缩写FB Score),还给每个分数配上了置信区间,也就是"这个分数大概率落在哪个范围内"的统计学表述。

> 置信区间:统计学上表示不确定性范围的一种方式,比如"95%置信区间是61.0到69.2"意思是,如果反复抽样重新计算,有95%的把握真实值落在这个区间里

具体的做法是用了一种叫"自助法"(bootstrap)的统计技巧,跑了整整5万次的重新抽样计算,得出每个模型分数的波动范围。同时,论文还对27个模型两两之间做了配对比较,一共351对(27个模型两两组合的数量),每一对都用了10万次的模拟检验(叫"符号翻转检验"),并且用了"Holm校正"这种统计学手段来控制"多重比较"带来的假阳性风险。

> Holm校正:当你同时做很多次统计检验时(比如这里做351次两两比较),偶然出现"看起来显著但其实是巧合"的结果概率会飙升,Holm校正是一种数学方法,专门用来压低这种误报率

结果显示,351对比较里,只有101对能在统计学意义上确认"谁比谁强",剩下的250对,虽然点估计分数有高低,但差距在统计上"不显著",论文管这种情况叫"未解决"(unresolved)。

这个设计特别值得说一说,因为它诚实地承认了排行榜的局限性。很多榜单只给一个从高到低的名次列表,读者天然会以为"排名第五一定比排名第六强"。但FlavourBench明确告诉你:这351对比较里,超过七成的名次差异,可能只是噪音,不能拿来做定论。

这就好比学校期末年级排名,如果两个学生总分只差了0.3分,你能说前者一定比后者学习能力更强吗?考虑到考试本身存在偶然性(那天状态、题目难度分布的运气成分),这0.3分的差距完全可能是噪音而非真实水平差异。FlavourBench的做法相当于给每个名次都标上了"这个名次到底可不可信"的信号灯,而不是简单粗暴地按分数从高到低排一条线。

结果揭晓:谁赢了,谁又输得挺惨

最终成绩单里,Grok 4.6拿到了最高分65.1分,置信区间是61.0到69.2。紧随其后的是Gemini 3.1 Pro,65.0分,几乎是并列第一,两者之间的差距在统计上完全无法确认谁更强。

再往后是GPT-5.6 Sol Pro(64.2分)、Muse Spark 1.2(63.8分)、GPT-5.6 Terra Pro(63.7分)等等,这一批模型的分数扎堆聚集在60分出头到65分之间,论文把它们归为同一个"统计分组"(Group 1),意思是这个分组内部的名次差异,大多经不起统计检验的推敲。

垫底的是Cohere的Command R+,只有47.9分,是所有模型里唯一一个明显被甩开的存在,它单独属于最后一个统计分组(Group 3)。

有一个特别有意思的数据对比,论文专门算了"纯随机瞎选"能拿多少分,答案是大约31.5分(图中橙色虚线标出的"平均随机基线")。也就是说,即便是垫底的Command R+,47.9分依然明显高于随机乱选的水平,说明所有参赛模型至少都具备一定的烹饪常识,只是水平参差不齐。

从三大类题目的分项表现来看(论文附了详细的分类得分表),"约束类"题目的整体分数明显偏低,大多数模型在这类题上只能拿到40分出头,而"搭配类"题目普遍能拿到65到70分左右。这说明什么?

这说明模型在"给定自由发挥空间去联想搭配什么好吃"这件事上做得相对不错,但一旦加上硬性规则限制(比如必须素食、加工等级不能超标),准确率就会明显下滑。这背后的原因大概是,搭配任务考验的是语言模型最擅长的"语义联想"能力,而约束任务需要模型同时满足多重逻辑条件,还得在满足条件的前提下再去优化口味,这是一种更接近"逻辑推理"而非"联想"的能力,对语言模型而言显然更吃力。

两套题库互相验证:结果到底稳不稳

前面提到过,研究者做了两套独立编制的题库,互不干扰。这样设计的目的,是想验证一件事:这套排名到底是"真实反映模型能力",还是"恰好这套题目适合某几个模型,换一套题目排名就乱了"?

论文给出的答案是,两套题库算出来的模型分数,皮尔逊相关系数是0.89,排名的斯皮尔曼相关系数是0.80。

> 皮尔逊相关系数:衡量两组数字之间线性关系强弱的统计指标,取值从-1到1,越接近1说明两组数字越是同步变化

斯皮尔曼相关系数:类似皮尔逊系数,但衡量的是"排名顺序"是否一致,而不是具体数值大小是否成比例

0.89和0.80都算是相当高的相关性,说明这套评测系统具备不错的稳定性,不是"换一套题目排名就大洗牌"的脆弱结果。当然论文也很谨慎地指出,这两个系数只是"描述性的稳定性诊断",不是拿来做模型选择的规则,真正的排行榜和不确定性估计,是把两个题库的534个题目全部合并一起算的。

从评测到训练:这套系统还能干什么

论文最后提出了一个挺有想象力的延伸方向。

既然每道题的56种组合分数都已经提前算好了,这套系统其实不只是能拿来考试,还能直接拿来当训练素材。

具体来说,可以用最优组合去做监督学习,可以用任意两个组合之间的分数差异去做偏好学习(也就是让模型学会"哪个更好"而不只是"对不对"),甚至可以直接拿这套连续的、有梯度的分数当作强化学习的奖励函数,训练模型在没见过的新食材组合上做决策。

不过论文也特别强调了一个边界,这次实验只是拿这套系统去"考试",并没有拿它去"训练"任何模型。如果直接拿测试集的分数表去训练,那测出来的就是"死记硬背的记忆力",而不是"举一反三的烹饪推理能力",这两者是完全不同的东西。

这就像老师出了一套模拟题给学生检验水平,如果学生直接把模拟题的标准答案背下来,下次考试遇到一模一样的题固然能拿满分,但换一套题立刻打回原形。真正有意义的训练,应该是用一套题目练手,再拿完全没见过的新题目去检验有没有真正学会思考方法,而不是学会了背答案。

这套系统的边界在哪里

论文的诚实之处还体现在,专门用了一节内容讲清楚这套评测的局限性。

首先,FlavourBench Score衡量的是模型和Epicure这一个特定系统之间的一致程度,不是什么"放之四海而皆准的人类口味真理"。换句话说,如果Epicure本身对某些地域菜系或者小众食材的理解有偏差,这种偏差也会传导进最终的排名里。

其次,这次的任务只是"从八个选项里挑三个"这种约束型选择,并不涉及完整的菜谱生成、实际烹饪操作、食品安全建议,或者更复杂的长线厨房规划这些更贴近真实场景的任务。

另外,前面提到的"共同核心"筛选规则虽然保证了公平性,但代价是牺牲了一部分数据,那些没有被全部27个模型答对的题目就被排除在主榜单之外了,好在这部分数据也被完整保留在了公开发布的附加数据集里,供有兴趣的研究者继续挖掘。

写在后面

读完这篇论文,最让我意外的一点是,它选择了一个看起来"不够宏大"的领域,烹饪食材搭配,来验证一个其实很宏大的方法论问题:怎么在没有人类裁判、没有AI裁判的情况下给开放式任务打分。

这个选择其实挺巧妙的。因为烹饪搭配这件事恰好卡在一个特殊的位置上,它足够主观(不像数学题有唯一答案),但又存在一套可以被算法量化的客观规律(食材的化学风味成分是可以被建模计算的)。这种"半主观半客观"的特性,让它成了检验评测方法论的一块完美试验田。

论文里那个"351对两两比较里只有101对能站得住脚"的数据,其实是我读到的最诚实的一部分。太多榜单只给一条从高到低的名次线,让人误以为差一名就代表能力有真实差距。这篇论文顶着"排名不够漂亮"的代价,把统计学的不确定性摊开给你看,这种克制反而更值得信任。

有一个问题我没想明白:如果Epicure这个"裁判系统"本身对某个菜系(比如说,某种小众地方菜)存在系统性理解偏差,会不会导致某些语言模型只是因为"更贴近Epicure的训练数据分布"而系统性地拿高分,而不是因为它真的更懂烹饪?这个问题论文里提了一句"外部效度是科学问题而非假设",但没有深入验证,这大概是留给后来者的一道题。

Q&A

Q1:FlavourBench是什么?

A:FlavourBench是一个自动化评测系统,用一套叫Epicure的可执行烹饪算法给27个顶尖语言模型的食材搭配决策打分,全程不需要人类裁判或AI裁判参与主观判断,而是通过提前算好的分数表直接查表打分。

Q2:FlavourBench排行榜里谁得分最高?

A:Grok 4.6得分最高,为65.1分,95%置信区间是61.0到69.2,紧随其后的是Gemini 3.1 Pro,两者分数极为接近,统计上很难判定谁真正更强,垫底的是Cohere的Command R+,得分47.9分。

Q3:FlavourBench的评测公平吗,会不会有些模型能作弊?

A:论文设计了严格的"共同核心"机制,只统计全部27个模型都成功回答的534道题目,筛题过程完全不看具体得分,同时禁用了自动切换路线的功能,保证每个模型的答题环境一致,尽量降低了不公平因素。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
稻盛和夫:人必须出门,必须社交,必须见不同的人——脑子才会思考,才感觉自己活着

稻盛和夫:人必须出门,必须社交,必须见不同的人——脑子才会思考,才感觉自己活着

杏花烟雨江南的碧园
2026-08-30 15:15:03
贾玲又胖起来,本人回应:实在维持不住,网友:我们玲儿又回来了

贾玲又胖起来,本人回应:实在维持不住,网友:我们玲儿又回来了

喜欢历史的阿繁
2026-09-02 09:16:34
科大讯飞出轨女主更多照片曝光:她长得娇小可爱,丈夫应该再给她一次机会

科大讯飞出轨女主更多照片曝光:她长得娇小可爱,丈夫应该再给她一次机会

汉史趣闻
2026-09-01 13:47:29
新一代理想MEGA被曝爆单 门店加急处理锁单订单

新一代理想MEGA被曝爆单 门店加急处理锁单订单

CNMO科技
2026-09-02 22:40:11
使用辅助驾驶撞车被认定全责,一理想车主索赔5万元,理想:辅助驾驶有局限,司机是第一责任人

使用辅助驾驶撞车被认定全责,一理想车主索赔5万元,理想:辅助驾驶有局限,司机是第一责任人

91.6陕西交通广播
2026-09-02 15:42:47
一旦赵勇下课,中国女排新的掌门人,九九成在这三人之间产生

一旦赵勇下课,中国女排新的掌门人,九九成在这三人之间产生

挽袖清风g
2026-09-02 12:34:38
地方电视台收视基本为零,业务无以为继,还有存在的必要吗?

地方电视台收视基本为零,业务无以为继,还有存在的必要吗?

许三岁
2026-08-27 23:52:55
忍了整整四年!国家终于出手了:以后车自己开,撞了要找车企算账

忍了整整四年!国家终于出手了:以后车自己开,撞了要找车企算账

真的好爱你
2026-09-03 03:33:10
6-3,6-2,郑钦文横扫昔日克星,终结三连败+复仇8年之耻,下轮对手更强

6-3,6-2,郑钦文横扫昔日克星,终结三连败+复仇8年之耻,下轮对手更强

主宰稳场
2026-08-25 09:21:40
陪睡陪玩只是开胃菜,舔手指塞拳头、集体嫖娼、背后的事藏不住了

陪睡陪玩只是开胃菜,舔手指塞拳头、集体嫖娼、背后的事藏不住了

北海史记
2026-08-12 19:57:54
1942年,华君武画漫画讽刺延安,毛主席请他吃饭:这究竟哪里不好?

1942年,华君武画漫画讽刺延安,毛主席请他吃饭:这究竟哪里不好?

史辨人生
2026-09-02 10:15:15
一路走好!知名演员离世,死因曝光,一生娶4个老婆,结局太唏嘘

一路走好!知名演员离世,死因曝光,一生娶4个老婆,结局太唏嘘

娱说瑜悦
2026-09-02 18:57:14
胡锡进对孙宇晨《致胡锡进老师》的回复

胡锡进对孙宇晨《致胡锡进老师》的回复

DoNews
2026-09-01 23:16:59
碧桂园的烂摊子比恒大更难收拾:许家印已判,杨惠妍二次创业求活

碧桂园的烂摊子比恒大更难收拾:许家印已判,杨惠妍二次创业求活

郭蛹包工头
2026-09-02 18:59:40
华列兵已任中央纪委国家监委驻中央港澳办纪检监察组组长

华列兵已任中央纪委国家监委驻中央港澳办纪检监察组组长

澎湃新闻
2026-09-02 08:16:27
“全面伊朗胜利!美国海军第五舰队被摧毁!”

“全面伊朗胜利!美国海军第五舰队被摧毁!”

果妈聊娱乐
2026-09-02 10:25:33
太荒诞了!孙宇晨发布公开招标测量他身高的帖子,精度毫米,网友评论炸锅

太荒诞了!孙宇晨发布公开招标测量他身高的帖子,精度毫米,网友评论炸锅

火山詩话
2026-09-02 16:18:42
哈兰德与女友长相出众,女友长得像洋娃娃,十分登对,浪漫幸福

哈兰德与女友长相出众,女友长得像洋娃娃,十分登对,浪漫幸福

娱你同欢
2026-08-30 18:30:43
不再逼生二胎三胎!2026生育新政大转向,一胎家庭直接享普惠福利

不再逼生二胎三胎!2026生育新政大转向,一胎家庭直接享普惠福利

蜉蝣说
2026-09-02 17:55:25
燃爆全场!女篮世界杯生死大战来袭,CCTV5全程直播,中国女篮誓撕碎美国强敌

燃爆全场!女篮世界杯生死大战来袭,CCTV5全程直播,中国女篮誓撕碎美国强敌

光影拾贝
2026-09-02 13:15:50
2026-09-03 04:39:00
科技行者 incentive-icons
科技行者
科技正在如何变革商业世界
9721文章数 568关注度
往期回顾 全部

科技要闻

凌晨最强模型上新,Claude Fable 5.1发布

头条要闻

游客拍下疑冰崩画面:土石翻涌 山间有黑色物体涌出

头条要闻

游客拍下疑冰崩画面:土石翻涌 山间有黑色物体涌出

体育要闻

一次有奖问答,让他成为欧冠主帅

娱乐要闻

香港武打影星陈观泰离世,终年80岁

财经要闻

星宇股份的麻烦,才刚开始

汽车要闻

配双腔空悬+机械差速锁 传祺越7预售权益价17.18万起

态度原创

手机
数码
旅游
房产
公开课

手机要闻

三天连着!OPPO、荣耀、vivo齐发布新款系统,到底谁会是最终选择?

数码要闻

戴森发布首款口腔护理科技CameraJet可视成像牙刷

旅游要闻

张昌平畅想AI数字漫游:从盘龙城直达三星堆 铸造青铜大立人|名人大讲堂

房产要闻

新四代住宅 新样板间开放丨以艺术之名 赴一场迭代之约

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版