最近很多朋友都在说,在使用心得ChatGPT6 Astra之后 tokens的额度直接不够用了,即使是 plus版本的ChatGPT用户,5分钟就没有额度了。
尤其是在操作blender的时候,在制造相关游戏的时候,我尝试过,也是反复等待额度恢复之后才完成的这个对波游戏使用。
普通的付费plus用户几乎不够用
我在知乎上,还用户将其制造了红警2,也有制造了其他的普通平面游戏,或者第一视角的CS。
可是在利用blender做真人游戏的时候,仍然还是有差距,比如有一点涉及到使用blender做威尔斯史密斯吃面,就发现和之前做AI动画的还原度效果差距巨大。
其实这就是因为astra本质上是大语言模型,并且缺乏世界数据。
现在ChatGPT的数据仍然来源于语言文本以及传统平面视频,虽然大家都在用普通摄像头在做数据更新以及标注,但和物理世界的触碰、深度等数据还是远远不够,相较于MR设备每天睁开眼睛都是在采集空间计算数据,而现在这些手机就则是效率非常慢了。
数据源不一样,标注的方式也不一样
相较于文本标注,世界模型的标注要求在有时间、距离、接触、以及面积
![]()
vision Pro这些空间计算设备和普通的AI眼镜或传感器区别巨大
vision Pro不仅知道几何数据、还有深度、位姿、手部关键、场景网格,这些数据如果开发者获得了后,可以重建3D世界并且度量第一视野下人在3D世界的变化。
现在世界模型是吃RGB视频,可以做预测下一帧画面的模型,比如洗碗的动作看起来是在洗碗,但是真实提及、水会不会泼、以及手和碗接触的面基对不对,他并不知道。
普通眼镜是没有标签的,比如指尖相差了几毫米、以及握力大概多少,物体6DOF怎么变,是成功接触还是插肩而过,是传统RGB摄像头并不知道的。
举个例子,在同一段家务工作里, MR眼镜与普通RGB摄像头数据差异在下面这里
在空间计算头显,开发者可以得到:
水槽、水龙头、沥水架的度量网格
碗的大致尺寸和台面高度
双手 25 个关节左右的时间序列
头和眼先看碗还是先看空位
遮挡发生时仍可用网格补几何
全程在同一个世界坐标系里
而在普通眼镜 / 传感器大致得到:
第一人称 RGB
水声、碗碰撞声
头部加速度
事后估一个大概手部框或 2D 关键点
比如现在京东正在宿迁的joyegocam数据采集活动,这些设备数据集并不包含手指、网格数据,只能建设视觉世界模型,而不是建设空间世界模型。虽然也是作为机器人建设的数据中心,但是我认为只是杯水车薪。
因为MR的眼镜出货量会接下来逐步上亿,并且会成为机器人数据的标准采集,直接会解决掉所有现场的数据采集线下实验区域。
也就是这个原因,导致现在这些凡是有接触物理、以及头是扫描、接触面的时刻,同时也没有办法让LLM没有的标注。
![]()
所以MR眼镜普及之后,才会有这些数据完成标注,才能够真的自动化操作这部分动作达到与3D世界一样的效果
今天的分享就在这里。
找我交流与合作 空间计算与脑机接口系统开发
题图来自 Unsplash ,基于 CC0 协议, 如有侵权,请联系pmtalk123删除
“分享产品经理改变世界的点滴”
产品顾问| 产品咨询|培训合作
请添加微信PMxiaowanzi
最近我的原创
每日案例拆解库,AI等产品打卡群
我创建的产品设计打卡社群,加入后365天,每天体验一款APP。提升产品设计能力, 同时有1300份体验报告帮助你找到竞品
在这里你可以随时查询到你想找的各类竞品行业APP,无须自己亲自下载就可以马上得到APP的一手产品优化、交互设计、功能描述信息。
从优化&建议、商业模式、运营、功能描述、交互设计、产品定位至少6个维度,体验一款应用。
平均1天1块钱,扫码购买即可加入
连续体验48款应用,通过后原路退回
报名后添加星球助理
PMTalk123
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.