“以前想把一个公司内部流程教给 AI,你要么抓破脑袋写几页操作手册,要么求 IT 团队写代码排期。”Grok Bot 这段演示视频之所以被反复转发,恰恰是因为它把这句话里的两个选项都删掉了。
演示里的做法很直接:工程师接管电脑,在 Google Slides 里手动做一遍动画排版,Grok Bot 在后台记录视觉变化与点击轨迹,做完之后直接封装成一个可调用的专属技能。下次再碰到类似需求,Bot 顺着这个工作流自己跑。
![]()
被神化的不是AI,是输入方式
很多人看完直呼 AI 成了精。但如果把那些神化“AI 偷师学艺”的词剥掉,它真正解决的根本不是 AI 有多聪明,而是终于不用逼着人类写三千字提示词,去向一个模型解释那个该死的按钮在屏幕什么位置了。
真正值钱的转变不是 AI 拥有了开悟的灵性,而是人类知识输入的接口彻底变了。过去想让自动化工具帮你干活,最痛苦的不是执行,而是交代任务:你要截图、标红框、写长篇大论的提示词去描述界面。
示教学习相当于给系统装上了三件套:
- 眼睛是多模态录屏器,扫过界面的每一个元素状态;
- 脑子是语义提取器,把一次性动作抽象成带参数的标准工序;
- 手是带容错的自动脚本,下次遇到同类任务照方抓药。
你用最本能的肌肉记忆点一遍,就把深埋在脑子里的隐性流程全交接了。大模型最大的浪费,就是让懂业务的人天天在提示词里扮演人工编译器。
两个必须讲清的现实
但如果你以为从此所有岗位都能一键复制,有两个残酷的现实绕不过去。
第一,录制下来的只是顺风局的操作轨迹。一旦目标网页稍微改版、或者跳出一个意料之外的验证弹窗,缺乏异常处理分支的 Bot 会瞬间卡在原地。
第二,它学会的是怎么点,而不是为什么要点。当业务数据发生冲突时,它依然无法做价值取舍。
这两条限制指向的是同一件事:示教学习交接的是动作序列,不是判断力。它能覆盖的是那些路径稳定、边界清晰的重复操作,一旦任务需要临场权衡,录下来的轨迹就失效了。
门槛被打平的是哪一段
正方会说,能把一次手动画面的操作变成长期复用的技能,确实把普通人做自动化的门槛打平了一大截。过去这道门槛卡在“交代任务”上,现在卡点被移除了,懂业务的人不需要再学一套描述语言。
反方会说,门槛只是从输入端挪到了维护端。录制出来的技能需要有人盯着它别跑偏,网页一改版就得重新教一遍,这笔账未必比写提示词便宜。
我的判断是:两边说的其实是不同阶段的事。示教学习解决的是从零到一那一步,让一个流程第一次被系统接住;至于它能不能长期稳定运行,取决于这个流程本身有多规整。规整的流程,录一遍就够用很久;不规整的流程,录十遍也还是会在意外分支上卡住。
所以永远别担心自己的工作会被录两下就偷走。能被轻易复刻的从来只是鼠标指针的位移,那个在关键时刻知道什么时候该打破流程的人,依然是你。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.