豆包昨天正式上线Seedance 2.5了,我干的第一件事是,第一次给我豆姐充钱:500块,专业版高级套餐,三档里最贵的那一档。
![]()
![]()
这个模型大家实在等得有点久了。6月23号发布会官宣,说7月初正式上线,结果这一等就等到了7月的最后一天,中间社区里催更的、做各种猜测的都出来了。我从官宣那天起就惦记着它,所以昨天中午一开放,充钱这个动作没有任何犹豫。
等这么久,等来了什么?
Seedance2.0已经占领视频生成模型SOTA位置半年之久了,现在,终于被它自己的迭代给刷新了。其实模型能力还在快速提升的当下,让作品真正拉开差距的是分镜、审美这些人的变量。不过也不能说就没问题了,在此之前,先让AI按想法出片,中间还是有不少运气成分:prompt写得再细,第7秒出现什么、镜头往哪推,可控性都没那么强,模型随机性还在那。
但Seedance 2.5这次更新,我看完发布说明的第一反应是:字节在正面回应这个问题。
四个更新,全都指向同一个方向:控制。
单段30秒原生直出,一次生成不用拼接
prompt里直接写时间戳,指定第几秒发生什么
真实感增强,AI感下降
豆包里可以让Agent调用Skill,联动生图模型直出60秒视频
现在Seedance2.5入口就在豆包专业版的「视频生成」里:模型选Seedance 2.5,时长从4秒到30秒随便拉,比例从竖屏9:16到超宽银幕21:9都有。
![]()
前两条不用解释。第三条看起来是画质向的,其实也是控制:AI感下降意味着废片率下降,重roll的次数少了,这本身就是可控性。
那我当然要挨个验一遍了。下午一口气出了八条片子,实测用的prompt我也直接贴在对应片子前面,你复制进豆包改改就能用。先说结论:值。画面质量、音效的稳定性、多语言的准确度都超出了我的认知,比2.0又上了一个大台阶,生成速度也比我想象的快。唯一的缺点是容易撞上用量限制——不过按我这一个下午的测法,缺陷可能在我。
30秒直出,时间戳真的听话吗
先说最直观的那个数字:单段生成时长从15秒提到30秒。
很多人的第一反应可能是,哦,翻倍了。但我觉得这里面不只是量的问题。15秒和30秒之间,隔着素材和成片的界限。
广告行业的标准交付格式是15秒、30秒、60秒TVC。15秒的AI视频只够做一个片段、一个镜头组,你还得进剪辑软件拼。30秒直出,意味着开场、展开、高潮、落版,一条完整的广告片一次生成出来,不经过剪辑台。
我查了一圈2026年7月主流视频模型的单段生成上限:Veo 3.1单段8秒,Runway、Luma单段也都在10秒以内,国内的主流模型最长也停在15秒。Sora 2的Pro档配storyboard做到过25秒,不过OpenAI已经在4月底关停了Sora应用。在单段原生直出这个口径下,30秒目前确实没有对手。多说一句,2.5到现在还没有任何独立基准测试的分数,能力数字都是官方口径,所以下面我只写我自己测出来的东西。
不过延长拼接那条路确实能做得更长,有的模型靠extend能拼到两三分钟。但拼接的问题是每段衔接处都有一致性损耗,人物换脸、光影跳变。30秒直出是一次推理生成的连续叙事,人物、场景、镜头语言从头到尾是同一套。这是本质区别。
我出的第一道题就比较过分,算是一般只有商业大片才会考虑制作的用一只鸟作为锚点,用伪一镜到底的方式给观众带去沉静感。我是把主角设定成了我最爱的葵花鹦鹉,让它从1900年的帆船港口起飞,穿过1950年代的蒸汽码头,掠过70年代还搭着脚手架的歌剧院,最后落在2026年的玻璃都市里。30秒,一镜到底,横跨一百多年。
prompt原文,其实就是一张逐秒分镜表:
30秒一镜到底,电影感,胶片颗粒质感,镜头全程与一只葵花鹦鹉同速贴身跟飞,无剪切,光线随时代自然过渡。主角是同一只葵花鹦鹉:通体雪白,柠檬黄冠羽,全程体型羽色不变。0-6秒:清晨薄雾的1900年代帆船港口,桅杆如林,鹦鹉从一根桅杆顶端起飞,镜头贴身跟上,掠过收起的船帆和绳索。6-12秒:鹦鹉穿入一团白色晨雾,出雾时已是1950年代码头,蒸汽货轮鸣笛,吊机林立,码头工人推着货箱,鹦鹉低掠过泛着油光的水面。12-19秒:鹦鹉振翅爬升,掠过一片脚手架,正在建造中的白色贝壳形建筑只完成一半,工人在钢架间作业,夕阳把钢架染成金色。19-26秒:鹦鹉俯冲穿过两栋玻璃幕墙的间隙,幕墙反光扫过整个画面,出来时已是2026年的现代都市夜幕初降,玻璃高楼灯光渐次点亮,鹦鹉在楼宇间穿行。26-30秒:鹦鹉减速滑翔,落在一处居民阳台的木栏杆上,柠檬黄冠羽唰地竖起,歪头看向镜头,画面定格。全程规范:一镜到底无剪切感,运镜如纪录片跟飞般丝滑,四个时代的光线(晨雾青灰、正午灰黄、黄昏金、夜幕蓝)自然渐变,鹦鹉羽毛细节真实。
成片算是稳稳超出我预期了...四个时代全部出片:晨雾里的帆船桅杆、冒着黑烟的蒸汽货轮和吊机、爬满工人的脚手架、夜幕下灯光渐次亮起的玻璃都市,光线从青灰一路渐变到夜蓝,穿雾和穿光的转场把接缝藏得干干净净。最让我意外的是,我prompt里只写了「白色贝壳形建筑」五个字,它直接给了我悉尼歌剧院,还在旁边配了一艘悉尼湾的黄色渡轮——它从一堆场景描述里认出了我要哪座城市。鹦鹉的羽色和柠檬黄冠羽从头到尾是同一只,最后一帧落在阳台栏杆上冠羽唰地竖起歪头看镜头,和我分镜表的最后一行一字不差。
这种东西15秒是装不下的,你最多飞过一个时代就得收,起承转合刚好需要30秒。
同一个思路我又让一只橘猫在地面走了一遍:1985年的青瓦屋脊出发,钻过一条晾晒的白床单,出来就是2005年的网吧霓虹街;再钻过一个墙洞,出来是2026年的玻璃咖啡街区。
30秒一镜到底,电影感,胶片质感,镜头全程平稳跟随一只大橘猫(白爪,体型花色全程不变)沿中国南方老街的屋脊与墙头行走,无剪切。0-8秒:1985年黄昏,青瓦屋顶,橘猫沿屋脊小跑,街边晾衣竹竿挑着床单,楼下传来黑白电视的戏曲声,二八自行车铃声,猫轻巧跳过一根天线。8-12秒:猫钻过一条迎风鼓起的白床单,床单掠过镜头,出来时已是2005年,街边店招变成彩色灯箱,网吧霓虹闪烁,音像店门口贴满海报,猫沿着空调外机跳跃前行。12-19秒:猫在墙头行走,镜头随它平移,街上电动车穿梭,学生放学人流,猫停下看了一眼楼下炸串摊,继续走。19-24秒:猫钻进一个老墙上的破洞,镜头贴着钻入黑暗再钻出,出来是2026年,老街翻新成玻璃立面的咖啡街区,共享单车整齐排列,外卖骑手驶过,一架无人机从空中掠过。24-30秒:猫沿着咖啡馆的木窗台走到尽头,跳上窗台趴下,打了个哈欠,望向街道,画面定格,三十年的街声渐渐安静。全程规范:一镜到底无剪切感,三个时代的色调(暖褐、艳彩、清亮)自然过渡,猫的动作符合真实猫科动物物理。
两处转场都严格按脚本执行,猫的花色没变,prompt里点名的道具——炸串摊的蒸汽、放学的学生、无人机、黄色共享单车、外卖骑手——逐项兑现,1985年的街上也没穿越出智能手机。挑毛病的话:网吧霓虹招牌能认出「网吧」「音像」,但也混着两个它自己造的字,中文招牌偶尔还是有些问题。
30秒是量变,时间戳控制才是我这次最想验的东西。
上面两条prompt你应该已经看出来了,Seedance 2.5支持在prompt里直接写时间戳:0-6秒开场,6-12秒转场,19-26秒俯冲,26-30秒定格。每个时间段里的故事、视角、运镜、节奏,都可以单独指定。以前你写prompt是在向模型描述一个愿望,现在你是在给它递一份导演的分镜表。
话说回来,在prompt里排时间轴这个玩法本身不算新,Google去年10月就给Veo 3.1出过官方的timestamp prompting指南,Seedance 2.0时期社区里也有人这么玩。但在8秒、十几秒的时长里写时间戳,你最多排两三个镜头,30秒配上时间戳,才第一次装得下一个完整的起承转合,这两个能力是相乘的。
考一考影视级的调度
测到这我有点上头,又加了两道题,都是冲着「调度」去的。
第一道偷了希区柯克《后窗》的开场:一镜横移扫过一面亮灯的红砖公寓楼,每扇窗里一段独立的生活。
30秒一镜到底,电影感,夏夜深蓝色调与暖黄窗光对比,镜头匀速水平横移,无剪切。画面是一栋红砖老公寓楼的整面背立面,每扇亮灯的窗户里有独立的生活场景在同时进行。0-6秒:镜头从左上角一扇窗的特写开始,窗内一人在弹钢琴,琴声隐约,镜头缓缓拉出。6-24秒:镜头匀速向右横移,依次经过:晾衣服的女人、对着镜子练习拳击的青年、独坐吃面的老人、一家人围桌吃饭碰杯、一对男女在客厅跳慢舞,每扇窗内的动作独立进行互不干扰,楼下院子晾衣绳上的衣物微微飘动。24-30秒:镜头缓缓拉远升高,整面楼与星空夜色入画,所有窗户的暖光如舞台格子,画面定格。全程规范:横移速度均匀,每扇窗内人物动作自然连续,窗内外光比稳定,无镜头抖动。
成片里弹钢琴的、阳台上晾衣服的、一家人围桌碰杯吃饭的,各过各的日子互不串戏,镜头最后拉远,整面楼像一格格亮着暖光的舞台,砖墙爬着绿植,楼下晾衣绳挂着床单,工整得像剧组搭的置景。六个微型场景同时在演——考的不是画质,是模型脑子里能不能同时装下六件事。它装下了。
第二道更过分:一名红衣球员原地颠球,人和球的动作完全连续,背景每两秒换一个地方——2026年决赛夜的金色彩带雨、布鲁克林大桥后的曼哈顿灯海、里斯本的黄色电车,最后停在一座亮起「100」巨型灯牌的球场中圈。一颗足球从2026年的美加墨世界杯,一路颠到2030年的西班牙、葡萄牙、摩洛哥——那届正好是世界杯一百年。这条的玩法不在prompt在参考图:我给它喂了首帧加四张城市参考图,考的就是前景和背景能不能各听各的话。
成片里主角跨四个背景形象零漂移,颠球节奏没有断过一拍,每座城市都是明信片级的风光,「葡萄牙」「世界杯100年」的字幕一个不错——参考图里的城市性格它全接住了。前景锁死+背景硬切,这种动作匹配剪辑以前是剪辑师熬夜对帧的手艺,现在是prompt里的一句话。
广告、海报,和开口说话
前面都是秀肌肉,接下来三条算是和大多数人更贴近的商业需求场景。
第一条,电商单品广告。我出的题是一把橙灰配色的机械键盘,30秒环绕运镜:悬浮自转、键帽特写、轴体结构、翻过来看底面,最后落在木桌上出slogan。
30秒单品广告,极简商业摄影风格,浅灰背景棚光。主体是一把橙灰配色的机械键盘,造型全程严格保持一致不变形。0-6秒:键盘悬浮于画面中央缓缓自转,柔光扫过键帽。6-14秒:镜头快速推近,贴着键帽表面低空掠过,一颗键帽被按下弹起的特写慢镜。14-22秒:镜头从键盘一端穿入、另一端穿出完成270度环绕,期间键盘缓慢旋转配合,背景光色从灰过渡到暖橙。22-30秒:镜头拉远,键盘落回木质桌面,旁边浮现极简文字「敲下去的每一个字都算数」,定格。全程规范:产品造型和键帽字符任何镜头下不变形,环绕运镜丝滑无跳切,商业广告质感。
电商视频的命门是商品保真,环绕运镜里产品变没变形、字符糊没糊。成片里键盘造型跨镜头稳定,键帽排布在特写里经得起看,结尾那句「敲下去的每一个字 都算数」一字不差。小偏差有一个:我写的青轴,它给了我橙轴——大概是被整支片子的配色带跑了,不过作为广告这个改动反而更统一。
第二条算是我个人的小需求。我把《Claude Code入门到精通》的封面图直接扔给它:保持构图、配色、文字全部不变,让这张海报活过来。
参考图是一张图书封面海报。让这张海报活过来:保持海报的构图、配色和文字完全不变不变形,画面中的元素分层动起来。0-5秒:镜头从海报纸张纹理特写缓缓拉出,封面上的装饰元素开始轻微浮动,光影从左上扫过。5-11秒:封面主视觉元素逐层浮起产生空间纵深,背景色块缓慢流动,标题文字保持清晰锐利。11-15秒:所有元素回落归位,海报恢复静止,一道柔光扫过完成收尾定格。全程规范:文字任何时刻不变形不模糊,动效克制优雅,像高级出版社的动态书封。
它的演绎超出了我的脚本:封面变成了一本躺在橙色绸布上的实体精装书,镜头从封面的皮革纹理特写缓缓拉开,书腰上「从入门到精通」「花叔 著」全程清晰锐利。做过图的都知道,文字是AI视频里最先崩的东西,这条从头到尾零变形。
第三条,对白。官方这次专门宣称了对白与语言的改善:小语种、生僻字、口型节奏。我写了一条15秒的三语测试:一位女士先用中文聊AI的温度,再用粤语说饮杯咖啡先啦,最后来一句法语,顺带埋了「龃龉」这个生僻词。
15秒人物对白短片,写实风格,咖啡馆窗边自然光,浅景深。一位30多岁的中国女性面对镜头坐着,神态自然放松。0-5秒:她用中文说:很多人说AI冷冰冰的没有温度,我倒觉得,温度一直都在用它的人手上。口型与语音精确同步,表情随语义自然变化。5-9秒:她端起咖啡喝了一口,轻笑,用粤语说:饮杯咖啡先啦。9-15秒:她放下杯子,看向窗外再回头,用法语说一句简短的日常问候,然后用中文说:前面就算有龃龉,也挡不住我们往前走。画面定格在她的微笑。全程规范:三种语言的口型与发音同步,生僻字龃龉的发音准确,人物形象全程一致,无恐怖谷感。
三种语言的口型都对上了,粤语有那个调子,生僻字没读错,人物从头到尾是同一张脸,表情跟着语义走。多语言表达的准确度,是这次所有测试里最超出我认知的单项。
顺带说两个插曲,它们是同一个故事。这条prompt的第一版被拦了,提示「输入文本可能涉及版权限制」——我台词里写了句Cest la vie,它是好多首歌的歌名,连prompt里的台词都在过版权扫描。另一条棒球短片,我想用一张AI生成的开球女孩垫图做图生视频,也被拒了:出于肖像保护考虑,未认证人脸不支持生成。
![]()
真人脸的生成现在还稍微有点障碍,必须经过认证才可以。不过现在Seedance确实有些太强了,为了避免乱象,这倒是也能理解。
被低估的教育科普场景
宣传片和影视镜头是视频模型的showcase场景,但我自己更常遇到的需求其实是另一类:把一个知识点讲清楚的短视频。
我是B站UP主,深知做一条科普视频的成本大头不在懂知识,在把知识变成画面:找素材、做动画、配解说。这类内容不需要电影级的光影,需要的是准确、清楚、快。
我出的题是用黏土定格动画讲「什么是Agent」:一个蓝色黏土小机器人自己扫地、把碗放进水槽、在日历上打勾;搬不动大石头,就自己捏一个小助手出来帮忙;最后一屋子彩色小机器人各自忙碌,黏土立体字浮现「这就是Agent」。
30秒黏土定格动画科普短片,超轻粘土质感,一帧一帧的定格动画感,明亮暖色棚光,画面可爱干净。主角是一个蓝色圆脑袋黏土小机器人。0-7秒:黏土小机器人坐在桌前发呆,头顶弹出一个黏土问号,字幕浮现「什么是Agent?」;旁白:AI只会聊天?那是老黄历了。7-15秒:小机器人跳下椅子,自己拿起黏土扫帚扫地、把黏土碗放进水槽、在黏土日历上打勾,每个动作都是一顿一顿的定格感;旁白:给它一个目标,它自己拆步骤、自己干活。15-23秒:它遇到一块搬不动的黏土大石头,挠头,然后捏出一个黏土小助手帮忙一起搬,两个小人击掌;旁白:搞不定的事,它还会自己找帮手。23-30秒:镜头拉远,一排黏土小机器人在各自忙碌,中间的主角向镜头挥手,字幕浮现「这就是Agent」,定格;旁白:会自己干活的AI,才叫Agent。全程规范:黏土材质细节真实,定格动画的跳帧节奏统一,中文字幕无错字。
成片的黏土是真有指纹和接缝那种质感,四幕结构一幕没少,立体字幕一个错字没有。最打动我的是「捏出一个小助手」这个动作它真拍出来了——搬不动就造个帮手,这不就是Agent调子Agent。一条30秒的概念科普,从想法到成片十几分钟,这在过去是外包给动画工作室按周计费的东西。
测了一整天,说两点感受。
一是稳。这次给我冲击最大的不是哪条片子多惊艳,是稳定性:一个下午八条片子,没有一条要扔进回收站,基本上都是一次成型的状态。这个良品率放在半年前想都不敢想。
二是恍惚。遥记得Sora横空出世那个春节带给行业的震撼,没想到现在整个视频领域几乎全是中国模型的天下了。
对了,豆包这次还把Seedance 2.5接进了办公任务模式的技能板块:对话框里斜杠唤起「创意视频」,给它一个模糊需求,它自己拆分镜、调Seedream 5.0 Pro出首帧、再调Seedance 2.5出片,最长能生成60秒(可惜想测更长的视频生成时限额了)。
![]()
最后说下怎么用上。入口在豆包专业版(加强或高级套餐),两种用法:
直接生成:「视频生成」里选Seedance 2.5,时长4到30秒随便拉,适合你自己会写prompt、想精确控制的场景
Agent出片:办公任务模式的「技能」板块里选「创意视频」,或者对话框里斜杠唤起,把需求说清楚就行
建议从时间戳prompt玩起,这大概是这一代最值得花时间学的东西。这次实测的prompt我都原样贴在上面对应的片子前面了——一镜到底时代穿越、整楼窗格横移、电商单品、海报激活、三语对白、黏土科普都在,直接复制进豆包,改改场景就是你的分镜表。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.