这周五腾讯混元Hy4 preview终于上线可测了,看第一波评论还不错的样子。
但当时我手边没法测评,所以先刷了一圈快评,结果大多是通稿变体,没看到深度实测任务,反倒在一个UP主的直播间看到了活儿。
我点进去的时候,他在用HY4连接游戏引擎在搞游戏开发,开始本来想建模古建筑群,但测出来一看,只有一个建筑,没有“群”。
直播间里也没有群嘲,反倒有点怪UP是不是把名字取太长了。
然后UP主又用HY4做了个有点Roguelike元素的小游戏。本命是颗小红豆,被放上一块悬浮在太空里的网格。它沿着发光方块移动,触发数字、能量和攻击效果。
每轮结束,屏幕弹出“选择遗物”,让玩家从三个能力中挑一个。
游戏跑一会儿,画面忽然暗下去,中央出现“熵核已沉默”,这一局就没了。
实话说,运行效果有点普,果然不能只看第一波通稿评论...
抵不住沉浸式陪测真的kill time,我本来只想扫两眼,结果一不小心待了三个多小时,退出时还有好几百人在线。
我真觉得现在进B站有点中毒。前段时间MiniMax H3刚发的时候,我想去看看有没有量化后模型的测评,结果看官网线上版、开放权重版和社区改造版之间的对比评测就耗掉了半天。
根据我的经验,现在模型上线前的大量灰测,基本只有在这里看得到最全。只要你蹲一个直播间,就可以给主播出题测试,主播没跑出来,直播间其他人大概率还能给你复现。如果还原不了,UP主会公开链路让大家核对。
虽然X和小红书上有很多模型测试的结果,GitHub有最全的模型使用沉淀,但模型还有一个重要的生命线,就是模型验证的"过程"。
这个过程要记录一整段思维链的滚动,需要几十分钟的逐题测试,还得一次次换条件重跑,文字贴不下,只有长视频+直播承载得了。
这两天看到也有开发者说,自己会去B站蹲用户需求,然后把它们做成Skill或产品,再搞去GitHub,整个搞成一条链路。
没想到B站这个曾经的宅基地,因为有了一群喜欢折腾AI的人自发地在这里测试模型、讨论技术、开发工具,已经不知不觉变成了最活跃的民间AI市场。
![]()
![]()
![]()
![]()
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.