![]()
手里拿着锤子,周围就都是钉子,一锤一个准。
自己是钉子,能不能赶紧变成个锤子?
文|JeffHill
几年前,AR圈子里一直流行“AR眼镜距离「iPhone时刻」还要多久”的高谈阔论,以及什么才是AR眼镜的Killer App。这些Topic现在已经没什么人谈了,话题中心全转移到了AI。
今天基于Transformer架构的通用基础大模型,相比几年前用专门架构进行图像识别、语音识别、文本生成的小参数体量AI,两者就像是猴子跟智人的区别,而且仅仅三年就完成了这种夸张的演化。从AR圈跨界到AI圈,只有躬身入局才能体验到那种应接不暇的震撼,以及被震撼后的久久沉默。
![]()
大语言模型,不就是把文字、语音、图像、视频变成很多维度的数学向量,以一种标准化切分的Token为起点,然后靠着大模型那一大堆被训练出来的参数,来激活、计算、预测下一个Token。大模型的参数其实就是y=kx+b 这种初中生都能懂的线性方程的参数,无数个线性方程的堆叠和激活参数进行计算这种简单伎俩,AI运行时无法探究底层变化的黑箱,居然神奇地写出很专业且风格各异的文章,输出几百页最前沿最复杂的数学推导攻破千禧年难题,攻破编程天花板中的的算子开发,以及很多...
大模型本质就是一大堆参数,就像你虽然是一个智人,但本质上也不过是一大堆神经元的塑造、激活和感官信息处理的过程载体。
更祛魅的是,我们正经历的大模型,好像正在完成一场宇宙大爆炸,它的诀窍好像就是Scaling,「参数空间」的不断膨胀。首先是预训练的参数,从百亿跨越到了万亿级乃至今天的10万亿级,预训练不断Scaling。然后是魔改注意力机制,越来越多层乃至具备“类Attention机制“的残差连接。还有强化学习后训练Scaling,运行时思维链Test-Time Scaling,同一组参数多轮循环的Loop 面向思维「深度」的Scaling,以及成千上万独立有Tool Use的Agent 数量进行并行探索的Scaling。支持大模型的算力、内存带宽和能源可以无限扩展,人之所以为人的智慧,那区区几十寒暑能吸收的知识、探索、强化学习,人类那可怜的一点信息带宽和上下文能力,被机器超越,已经真的没什么悬念。
毫无疑问,AI 就是那个追求多年的Killer App。AIUI,以MUSE为代表的「真端到端」接管一切的Personal Agent,那种安全运行在云端的沙箱电脑,可能才是AI眼镜的核心竞争力。而眼镜只需要做好三个事情——全彩高透自然视物的AR显示,连接云端Agent的网络,和Always-on的多模态的输入(传感器)。最多再加上一个眼镜本身集成的端侧模型和端侧Agent。
AI和眼镜,可能就是iOS系统和iPhone硬件本身的关系,但iOS重要还是iPhone本身重要,先有鸡后有蛋,谁才是成功的关键,很难分得清。
AI眼镜厂商,能不能同时自研LLM / AI Agent 和做好眼镜,或者说,谁有能力做iOS和iPhone的垂直整合?目前看只有Meta。其他家,难道只能像过去那样,用着巨头的Android系统,成为安卓机海中的一员,然后幻想自己能成为三星、华为、小米、OV?
很大可能,未来所有的AI眼镜厂商,都要面临这个灵魂拷问。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.