“终于不用逼着人类写三千字提示词,去向一个模型解释那个该死的按钮在屏幕什么位置了。”
这句话,基本概括了 Grok Bot 那段演示视频里最扎人的地方。视频里没有炫技的对话,也没有堆参数,只有一个工程师接管电脑,在 Google Slides 里手动做了一遍动画排版。
![]()
做完之后,Grok Bot 把这一串动作封装成了一个可调用的专属技能。下次再碰到类似需求,Bot 顺着这个工作流自己跑。
它到底在记录什么
剥掉那些“AI 成了精”“偷师学艺”的神化词,这套演示真正做的事并不玄乎。Grok Bot 在后台记录的是两样东西:视觉变化与点击轨迹。
你手动点一遍,它把鼠标的位移和界面的状态变化一起收进去,然后逆向编译成能跑的工作流。过去想让自动化工具帮你干活,最痛苦的不是执行,而是交代任务——你要截图、标红框、写长篇大论的提示词去描述界面。
示教学习相当于给系统装上了三件套:
- 眼睛是多模态录屏器,扫过界面的每一个元素状态;
- 脑子是语义提取器,把一次性动作抽象成带参数的标准工序;
- 手是带容错的自动脚本,下次遇到同类任务照方抓药。
你用最本能的肌肉记忆点一遍,就把深埋在脑子里的隐性流程全交接了。人类知识输入的接口,在这里彻底变了。
反方:两个绕不过去的坑
但如果以为从此所有岗位都能一键复制,有两个现实必须讲清。
第一,录制下来的只是顺风局的操作轨迹。一旦目标网页稍微改版,或者跳出一个意料之外的验证弹窗,缺乏异常处理分支的 Bot 会瞬间卡在原地。
第二,它学会的是怎么点,而不是为什么要点。当业务数据发生冲突时,它依然无法做价值取舍。
这两条不是吹毛求疵,而是示教学习这条路本身的边界。录下来的是动作,不是判断;是路径,不是目的。目标环境一变,路径就断了;数据一冲突,动作就悬空了。
我的判断
大模型最大的浪费,就是让懂业务的人天天在提示词里扮演人工编译器。懂流程的人把时间花在“怎么把流程描述给模型听”上,这件事本身就不合理。
能把一次手动画面的操作变成长期复用的技能,确实把普通人做自动化的门槛打平了一大截。以前要跨过写代码、排期、写手册这几道坎,现在你只要会点鼠标。
但门槛打平不等于岗位消失。能被轻易复刻的从来只是鼠标指针的位移,那个在关键时刻知道什么时候该打破流程的人,依然是你。
所以这套东西的价值,不在于 AI 有多聪明,而在于它把“交代任务”这件事的成本压到了接近零。至于判断和取舍,还是得留在人这边。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.