这是苍何的第 594 篇原创!
大家好,我是苍何。
看到小米 MiMo 桌面版发布了,并正式开启了邀测。
![]()
我托了一些关系,要到了邀测名额,然后在上海出差期间嘎嘎猛测。
毕竟这个邀测期间,还能免费体验两款 Xiaomi MiMo 新⼀代模型(代号 MiMo-X-Flash/Pro-Preview),算是一手内测了。
我还给粉丝要来了 10 个邀测名额,感兴趣的可以留言。
小米 MiMo Desktop 是 Xiaomi MiMo ⾸个⾯向个⼈⽤⼾真实⼯作场景的桌⾯ AI 应⽤,可以理解为是小米版 Codex。
但 MiMo Desktop 主要解决的是长程复杂任务,去交付高质量可用的结果。
![]()
最近 GPT-6 Astra 出来后,我看到不少人用它连接 Blender,做出来很多有意思的产品。
我也跟着试了试,刚跑一会儿,额度就快见底了,难受。
![]()
于是我换到了 Xiaomi MiMo Desktop,顺带也测测。
它是一款面向真实工作场景的桌面 AI 应用。你把图片、视频或者 PDF 丢给它,再说清楚要做什么,它会自己拆任务、调用工具,最后交付可以继续修改的成品。
![]()
先给大家看下效果叭。
我敲真实键盘,网页里的按键也会跟着按下、发声,还能拆开再复原。
我以前也玩 Blender,说实话Blender对于一个小白来说想搓出一个像样的作品,难度挺大的。
但是这次我只给了参考图和要求,全程没碰 Blender。
最后做出来的键盘有 90 多个零件,效果还真不错。
那到这里就有小伙伴问了,完全不会建模怎么做。
别急,往下看
这套键盘,我用的是 MiMo Desktop 里的 3D 创作 Skill。
![]()
我把机械键盘的三视图丢进去,让它调用 Blender,做一套未来感的 3D 键盘。
同时设计两个动画,拆解 W 键,再把整套键盘分层炸开。
![]()
等了一会儿,它给我发了一些效果图,这效果图已经很不错了。
![]()
但是我感觉看图片看不太仔细,就让它在 Blender 里面帮我打开。
![]()
模型确认没问题后,我又想把它放进网页里玩。
于是我让它先导出 glb,再做成一个可交互的 3D 网页。
导出模型、写网页、加交互,这几步串起来挺长,我直接开了 Goal 模式。
我只说最后要做成什么样,它会自己拆步骤往下做,中间卡住了,也会继续调整。
![]()
跑的过程中,右侧能看到任务进度和生成的文件,网页也可以随时点开预览。
这样我不用干等着,方向跑偏了也能及时发现。
任务结束后,它给了我访问链接,还列出了做好的功能和修过的问题。
![]()
说实话,感觉挺爽的。我以前连 Blender 的基本操作都没整明白,这次只给一张参考图,居然把建模、动画和网页全跑通了。
这类任务考验的是 AI 的长链路执行能力。 从理解参考图,到调用 Blender 建模、制作动画,再到导出模型、编写网页,每一步的结果都要能被下一步接着使用。
整个过程中,还要持续跟进任务进度,结合已有产物处理后续要求。
我看小米的介绍说,MiMo Desktop 基于 MiMo Code 框架,让新一代 MiMo 模型与 Harness(任务执行框架)协同优化,重点强化工具调用、上下文管理和任务编排。
这次从参考图一路做到可交互网页,就比较直观地体现了这种协同带来的任务完成度。
![]()
流程跑通后,顺手让它做成了一个 Skill。
下次换个物品,只要给它参考图,就能照着这套流程继续建模、做爆炸动画。
![]()
比如我让它做一个望远镜的建模爆炸效果。
这次直接复用刚才的 Skill,从建模到渲染视频,只用了 5 分钟。
第一次做键盘花了 40 分钟,第二次快了好几倍,不仅省时间还省token哈哈哈。
![]()
效果还挺像那么回事,零件拆分和爆炸动画都做出来了。
3D建模跑通后,我又换了种玩法。
这次我只丢了几张黄鹤楼和武汉夜景的照片,让它照着照片里的城市氛围,做一个旅行规划页面。
最后做出来还挺有感觉,点开每个地标,都能看到对应的介绍。
旅行页面里的交互比较简单,我决定再上点难度。
我一直蛮喜欢 GSAP 官网的设计和动效,想让它照着做一个。
但这种效果光靠文字很难说清楚,我干脆截了张图,又录了一段操作视频。
图片看样式,录屏看动效,我直接把两份素材一起丢给它。
![]()
最后做出来的页面,第一眼还真有 GSAP 官网那个味道。
配色和主要动效都还原了出来,它还顺手加了一些自己的想法。
只靠一张截图和一段录屏,能做到这个程度,已经超出预期了。
这里可以体现出 MiMo Desktop 多模态素材的互补作用。 截图提供布局、配色和视觉层级,录屏补充滚动、点击时的动态变化。
模型需要结合两种素材理解设计要求,再把这些要求转化为页面结构和交互逻辑。这也让一些很难用文字描述的效果,有了更明确的参考。
刚好最近 AI 硬件挺火,我让 MiMo Desktop 整理一份《2026 年 AI 硬件产业全景》研究报告。
它先拆分研究范围,再逐个查资料、整理数据。最后把所有内容做成了一份网页报告。
我看完以后,这几年 AI 硬件有哪些变化,基本就能快速摸清楚了。
网页报告看着有点长了。我就想把内容压一压,再配些图片,做成一份 PPT。
这次我开了一个会话,只说了一句:把刚才的报告做成 PPT。
结果它自己找到了上个会话里的研究报告,直接接着搜图、排版。
跨会话的成果复用还是非常有用的:前一个会话完成的研究报告,可以成为新会话制作 PPT 的基础,减少重新交代背景和搬运资料的步骤,让调研与内容制作衔接起来。
对我来说,就是换个窗口还能接着干。
![]()
等了一会儿,PPT 就出来了。
整体挺不错,但我感觉字有点太多,于是又让它改。
![]()
我懒得自己选模型,直接打开 Smart 模式,只丢了一句:
「文字太多了,多用图表和图片展示。」
按产品介绍,Smart 会综合评估任务类型、复杂程度、交付要求和执行成本,再匹配合适的模型、Agent 和 Skill,把质量、速度和成本一起纳入调度。
像这次调整 PPT,我只需要说明想怎么改,具体的执行路径交给它来安排。
![]()
模型和 Skill 都不用研究,直接说哪里不满意就行。
![]()
整体改完后,我又继续抠了下细节。
比如这页有组数字看着太干,直接框选它,让 AI 换成图表。
![]()
等了一会儿,它就把图表改好了。
前后一对比,重点信息更集中,也更适合演示。
![]()
不过,AI 改 PPT 也有翻车的时候。
有一版改完还不如之前,好在每次修改都会留下版本记录。
我直接点了版本回滚,马上退回修改前。
这样就不用担心 AI 瞎改,最后连原版都找不到了。
![]()
对于需要反复修改的工作,编辑粒度和版本管理会直接影响成品的可用性。 框选让修改要求能落到具体元素上,版本记录则让修改过程可以回溯。
两者结合,我就能逐步调整内容、检查效果,再决定保留哪一版,形成一个可控的修订过程。
我平时写东西会放点专注音乐,就顺手用 Smart 模式生成了一段自习室音乐。
第一版听着有点闷,我让它调得更清脆一些,很快就改好了。
大家可以听一下效果。
写到这里,我最大的感受就是终于不用自己收拾 AI 留下的残局了。
从建模到 PPT,成品都能直接打开,哪里不满意,可以接着改,改坏了还能回滚。
成本控制上,MiMo Desktop 主要做了三件事:Smart 根据任务需求匹配模型和执行路径;局部编辑缩小需要重新生成的范围;上下文缓存减少重复内容的计算。
![]()
三种机制分别作用于模型选择、修改范围和上下文复用。对于需要多轮沟通、反复修改的任务,有助于减少重复消耗。
按 MiMo Desktop 官方的测试数据来说,同会话缓存命中率最高可达 99%,跨会话最高可达 95%。
这个在使用体感上还是挺显著的。
AI 工具值不值钱,不看它能聊什么,看它能交什么活。
目前 MiMo Desktop 还是邀测预览版,所以我也更期待正式版了。
如果你也想上手,评论区有 10 个绿色通道名额,想玩玩的小伙伴可以留言。
通过后,可以限时免费体验 MiMo-X-Pro-Preview 和 MiMo-X-Flash-Preview。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.