把提示词写对,Wan3.0的出片质量能差出一大截。Picsart视频产品负责人Narek Hayrapetyan最近分享了他团队实际在用的提示词打法,从结构搭建、音频分层到Omni-Reference的用法,都给出了具体操作思路。他还坦率聊了聊这个模型在真实工作流里到底该放在哪个位置。
提示词结构:先搭骨架再填细节
![]()
Hayrapetyan强调,Wan3.0的提示词不是越长越好,而是要有清晰的结构。他的团队习惯先把画面主体、动作和场景这三块骨架定下来,再往里面补充风格、光线、镜头运动等细节。这样模型能更快抓住核心意图,而不是被一堆形容词带偏方向。
具体来说,一个完整的提示词应该包含几个层次:主体是谁、在做什么、发生在什么环境里,以及你想要的视觉风格和节奏感。把这几层分开写,比把一堆要求混在一个长句里更有效。团队内部测试下来,结构化提示词在画面一致性和动作连贯性上都有明显提升。
音频分层:别让声音拖了画面后腿
视频生成里,音频往往是最容易被忽略的一环。Hayrapetyan的团队在Wan3.0上采用了分层处理音频的思路:先确定整体声音基调,再叠加环境音、人声和音效。这样做的好处是,每一层都能单独调整,不会因为一个音效不理想就推翻整段音频。
他提到,很多人在用视频模型时只关注画面,结果生成出来的视频声音一塌糊涂。实际上,音频和画面同样需要提示词来引导。把声音需求写清楚,比如“雨天的街道环境音”“低沉的机械运转声”,模型给出的结果会稳定得多。
Omni-Reference:把参考素材用到位
Omni-Reference是这次分享里被重点提到的功能。Hayrapetyan的团队把它当作一个“锚点工具”来用:先给模型一个明确的参考对象,再让生成内容围绕这个参考展开。这样能减少模型自由发挥带来的偏差,尤其是在需要保持角色或产品外观一致的场景里。
他的建议是,参考素材不要贪多,选最有代表性的那一两个就够了。素材太多反而会让模型混淆重点。团队实际使用中,单参考对象配合清晰文字描述,比堆叠多个参考图的效果更稳定。
真实工作流里的位置:辅助而非替代
谈到Wan3.0在真实工作流中的定位,Hayrapetyan的态度比较务实。他认为这个模型更适合放在创意探索和快速出初稿的环节,而不是直接替代后期精修。团队的做法是先用Wan3.0快速生成多个方向,挑出最有潜力的那个再进入传统制作流程打磨。
这种用法把模型当成了“创意加速器”,而不是“一键成片工具”。他坦言,模型在复杂叙事和精细控制上还有局限,但用来快速验证想法、和客户对齐方向,效率提升非常明显。对于视频团队来说,关键是找到模型能真正省时间的那个环节,而不是指望它包办一切。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.