今年八月中,我把做 AI 视频这件事正式开了个头。
目标不复杂,让一个不会剪辑的人,也能把一段剧本做成能看的视频。角色是他描述的,场景是他要的,镜头一个接一个拼起来,最后出一个成片。
一个月过去,我砍掉了好几样东西。有些是用户点名要的,有些是我自己觉得非做不可的。砍完之后我才慢慢看清楚一件事:用户嘴上要的,和他真正会用的,中间隔着一大段距离。
这篇不写产品介绍,就写这段时间我在这条缝里踩出来的东西。
先说我遇到的最真实的一个问题
做这类产品,绕不开一个坎:一致性。
同一个角色,第一个镜头是长发,切个角度变短发了。同一个房间,上一个镜头门在左边,下一个镜头门跑到右边。观众能原谅画风糙一点,但两个人本来面对面说话,切个镜头都看向同一侧了,一眼就出戏。
这不是画质问题,是模型每次生成都在重新猜。它画的不是同一个空间,是几次独立的脑补。
这个问题用户不会用专业词描述。他只会说:你这东西做出来的,前后不是一个人。
我搭过一版很漂亮的方案,然后把它整个删了
为了把场景定死,我一开始想的招挺巧。
让模型一次性生成一张九宫格环绕母版图,把一个房间的八个方位一次画全。之后所有机位,都从这张图上裁格子去精修。思路很顺,一次成型,天然共享同一套几何。
我搭完了,跑起来了,提交了几十个版本。
然后真机把我打了回来。素材的时序对不上,用户的实际期望也对不上。最后我把这一整套东西回退撤销了。
但这一退,退出了我这个月最重要的一句话。模型没法在几次独立生成之间,记住同一个空间。你写多少条文字规则,都压不过它骨子里的视觉直觉。
为了这套方案,我的规则一路堆到一百三十多行。转盘机位、左右缘查表、镜像自检、正交反打取证、墙面内容清单,全写上了,还是不收敛。
问题不在规则不够多,在方向本身错了。
用户说想要,和他真会用,是两回事
做产品的头几周,我陷在另一个坑里,而且陷得很深。
我特别想一步到位。文档写得满满当当:用户体系怎么设计、权限怎么分层、数据怎么隔离、后面要接多少种场景。架构图画了好几版,每一版我都觉得还能再优化。
写了三个星期,能跑的东西是零。
不是我没干活,是我每天干的活都在准备阶段。今天觉得数据设计不对,改。明天觉得这层抽象不够漂亮,重写。改来改去,进度条一直没动。
后来我急了,逼自己换了个做法。这一周只做一件事,把主流程从头到尾跑通。丑不丑不管,稳不稳不管,用户体系先写死一个,权限先全放开。
那一周我拼出了一版特别丑的东西。界面是浏览器默认的样子,按钮全是原生的,颜色都没调,点一下还会顿一下。我做完自己都不太敢打开。
但它能跑。能从第一步走到最后一步,中间不断。
我把它发给第一个愿意看的人。本来准备了一堆解释,说这只是原型、界面后面会改、功能还不全。结果对方根本不在意这些。他点了几分钟,指着中间一个环节问我:我这里要是这种情况,它怎么办?
那一下我就明白了。
我前面三周纠结的那些架构问题,他一个都没提。他问的这个具体场景,我压根没想过。而这个问题,靠我一个人坐在电脑前空想,是永远想不到的。
现在回头看,那版丑东西最值钱的地方,是它把错误提前暴露了。如果我一直等到做完整再拿出去,可能还要再拖一个月,然后拿一个更漂亮、但依然跑偏的东西出来。
做 AI 视频产品尤其吃这一套。因为这条链上的每一环都在生成,你不早点让真人上手,根本不知道哪一环会崩。
一致性这条路,我走过三次死胡同
在删掉九宫格母版之前,我其实已经试过三种方法,全是坑。
第一种,让模型从一张正视图直接生成九个角度。九张图各画各的,视角之间没有几何关系,背面全靠猜。
第二种,用视频模型绕着物体转一圈,再从视频里截帧当不同视角。听着聪明,但视频模型没有真的三维概念,它转动的时候物体自己是会变形的。
第三种,三百六十度环绕截帧。转一圈下来,首尾对不上,整个场景是漂移的。
三次失败的病根是同一个:我都在二维空间里,让模型去演一个三维的东西。它学的是看起来像在转,不是真的在转。转动幅度一大,必崩。这是模型能力的边界,不是我参数没调好。
想清楚这一点之后,我换了个方向。既然二维抽卡怎么抽都抽不出一致的空间,那就别在像素层解决。先把正视图还原成一个真正的三维模型,几何定死了,再让机器按你要的机位去渲染别的角度。从猜,变成算。
这个转向,跟九宫格那次的教训是同一句话:几何的真相要来自几何本身,不能让大模型去定几何,它只能在最后一层做美化。
想通之后,我改了三件事
真正管用的几个转折,说出来都很朴素,全是少让模型自由发挥。
一是别让它分好几次画一个房间。后来的做法是一段环绕镜头一次拍完,第一帧接最后一帧,帧和帧之间天然共享同一条轨迹,几何自己就顺下来了。
二是一个机位只给一张参考图。我试过给一堆方位图,结果几张图互相打架。主流模型对多图的处理,是锁定主体,它不做空间推理。你给五张,它不会在脑子里拼出一个房间,只会把五张搅在一起。
三是能算的别让它猜。查表这种事交给代码算好直接喂进去,缺了关键参考图就直接报错,不许它降级硬编。
还有一条我走了弯路才补上的。给参考图,一定要写死一句话:只参考这张图里的长相,别参考它的构图和摆位。因为参考图是会泄漏的。你传一张站姿照进去,它下次可能把人摆回原来那个位置。你以为你在传长相,其实你把构图也一起传进去了。同一个角色,从第一个镜头到最后一个镜头,必须引用同一个资产,不能让模型每次重新描述一遍他长什么样。描述一次,就飘一次。
这个月我最大的收获,不是学会了怎么写提示词,是学会了什么时候不该写提示词。
我最后想清楚的一件事
用户跟我要功能的时候,说的是他的期待。他真正会用的功能,是他遇到问题时顺手会点的那一个。
这两个中间隔着一段路,只有把东西跑起来、拿给真人用,才能量出这段路有多远。
以前我做了十几年电商系统。那套东西复杂,但状态是清楚的。订单走到哪一步,数据库里写得明明白白,错了能查能补能回滚。
AI 生成不是这样。它每一步都差不多对,你得自己揪出哪一步是真的对。所以做这类产品,我越来越不敢在屋子里把方案想完美再动手。想得越完美,离真实用户越远。
那套九宫格母版我删了。但它没白删。正是它让我想明白,一次成型才是对的路,后面几版方案全是从这个结论里长出来的。
一次失败的方案,也是资产。只要你别把它当成功劳藏着,而是当教训摊开。
项目还在改,还有一堆债没还。生成的画面好不好,目前只能靠人眼看,没有自动验收。侧视角和正视角偶尔还是会对不上。再往上一步,是把整个场景换成真正的三维模型。
这条路还长。我不是做完了来教你,我是踩到了,来告诉你这坑长什么样。









