场景 即提示词。
几乎所有 AI 图像工具,都从一段文字描述开始——也就是提示词——然后听天由命。AutoGen 反其道而行。它从一个一切都已搭建好、测量好的 3D 场景出发,只在最后一公里才请 AI 出手:表面质感、氛围与照片级的真实感。
摄影机的精确位置、焦段和运动,来自真实的摄影机装置,而不是文字。车辆的几何结构、车标和车漆,来自这款车真实的 3D 模型,而不是 AI 对汽车的想象。AI 收到的镜头,就是你构好的那个镜头,像素不差,因为它所依据的参考图,就是你屏幕上画面的直接渲染。
这一切都无需手工搭建。车型、运镜、氛围和地点都已现成——你只需组合它们,或者输入一句话,场景便会自动布置好。场景要求严苛,制作场景却毫不费力。
0
0
0
0
0
看场景 变成照片。
拖动下方任意画面上的滑块。左边是 3D 草稿,行内俗称“白模”:完全按布置呈现的场景,有真实的车辆、真实的摄影机,以及粗略的替代布景。右边是 AI 返回的结果。AI 的任务不是想象一辆车,而是把场景早已布置好的照片冲洗出来。


一辆 EX5 EM-i,从正后方拍摄,置于应用内置的隧道中。AI 把空荡荡的隧道装点成双色 LED 建筑,并把那片色彩泼洒在车身上——但摄影机高度、构图、车标和“EX5 EM-i”车牌,全都来自左边的 3D 草稿。
“改成冬天”, 点一下就行, 不必重拍。
下面五段影片,都是同一段驾驶——一条镜头、一次运镜、一段 3D 草稿——送进 AI 五次,每次换一个世界。客户的一句修改意见,过去要花一天拍摄,或一个月的传统 CGI 制作,如今只需一杯咖啡的工夫。
同一条镜头,显影成夜晚充满未来感的地下通道——玻璃天桥、发光招牌、湿漉漉的柏油路。摄影机的运动始终如一。
车,还是那辆车。
每个品牌问 AI 视频的第一个问题,都是它会不会把产品“融化”。进气格栅扭曲、车标凭空出现、轮毂搅成一团——业内称之为“幻觉”,这也是大多数品牌对此敬而远之的原因。AutoGen 的回答在于结构:车辆从不交给 AI 想象。每一次生成,它真实的几何结构都会以图像形式输入;每一条指令都以同一句命令收尾:不给车辆添加任何东西,也不从车上删除任何东西。在动态画面上拖动滑块,看车身钣金纹丝不动。
沿着车尾侧面缓缓移动——这正是 AI 最容易搞砸的镜头。在画面上拖动滑块:GEELY 字标、EX2 车标、车牌和尾灯造型,在每一帧中都牢牢锁定在车辆真实的 3D 几何结构上,因为它们从一开始就不是想象出来的。
四个步骤, 一气呵成。
01
布置场景
选择车型、车漆、内饰颜色、车牌和一位出镜驾驶员——或者在“导演”栏里输入一句话,场景便会自动搭建。一切都经过测量,而非凭目测:焦段、角度、车辆在画面中的大小,以及车标是否可见。
02
场景写出提示词
应用会读取你刚搭建的场景——精确的车漆、玻璃、轮毂和饰件,以及你设定的画面——AutoGen 再根据这些事实,为 AI 写出指令。没有人需要输入提示词。
03
生成静帧
只需一次点击。3D 草稿画面和一张场景参考图随指令一同发出,画面以 2K 或 4K 返回,并与它所来自的 3D 草稿并排呈现,方便对照实际执导的内容进行检查。
04
生成影片
制作动态影像时,整个运镜会渲染成每秒 24 帧的 3D 草稿片段,再由 AI 显影为成片:静帧成为第一帧,运镜分毫不差地保留下来。标准输出 1080p,需要时可达 4K。
成品画面, 仍可修改。
AI 生成的画面通常是一条死胡同:一张扁平的图像,调色时能稍作调整,仅此而已。这些画面不是扁平的。由于底层有一个真实的 3D 场景,每个镜头还能导出视效艺术家继续处理所需的各个技术分层,也就是“渲染通道”。共十种,静帧与动态序列都能导出。
- 法线贴图
- 记录每个表面的朝向——这是给镜头重新布光所需的信息。沿着腰线提亮高光、加一道轮廓光、移动主光,全都可以事后完成,无需重新生成镜头。
- 深度图
- 记录画面每一部分与摄影机的距离。焦点、雾气和氛围在事后依然可调,而不是在镜头生成的那一刻就固定下来。
- 材质遮罩
- 按表面把车辆分离出来——车漆、镀铬、玻璃、车灯——这样改色只会落在车身面板上,不会溢出。遮罩取自驱动应用内车漆选择器的同一份材质数据,因此你重新着色的表面与遮罩标记的表面,从结构上就是同一个表面。两者不可能不一致。
4K 是生成的,而不是放大的。静帧以 2K 或 4K 生成,影片以 1080p 或 4K 生成,从一开始就按这个尺寸制作,而不是先做小图再放大。你收到的画面,就是按标称尺寸渲染的。每一帧还会与生成它的那个场景一并保存。这正是整套逻辑再往下一层:像素也许是生成的,但其下的 3D 是已知的——而凡是已知的,都可以交给后期团队继续处理。
天涯海角, 一一到过。 还有几处, 并不存在。
拿出你的全部车型。乘以配置等级。再乘以在售市场。没人能拍完这个数量:这张矩阵早在超出预算之前,就已超出排期。这里是工作资料库的一小部分:517 张成品画面,每一张都与生成它的那个场景一并保存,一键即可还原。

































靠工程, 不靠提示词。
图像胜过文字
当图像与文字相互矛盾时,AI 更相信给它的图像。所以一旦文字和画面不一致,AutoGen 会修改画面,而不是改写请求。
去测量,而不是去问 AI
AutoGen 从不问 AI“车标看得见吗?”应用会直接测量场景——构图、品牌标识、驾驶员是否可见——再把这些事实交给负责撰写指令的环节。
每个镜头都能重新运行
每次运行都会把确切的指令和每一张参考图,与结果一同保存。效果不理想时,只改一个变量,再运行一次——任何实验都是这样做的。
它如何融入 Ruse 的制作。
预演与分镜
经过执导的 3D 场景就是动态分镜。分镜、运镜和构图,都在任何人进棚之前,用真实的车型确定下来。
广告项目静帧
主视觉以及各种裁切和车漆版本,都与影片出自同一个场景,因此整个广告项目前后一致。
影片与导演剪辑版
运镜渲染成 3D 草稿片段,再由 AI 显影为成片。执导的是导演,而不是工具。
所有车型, 一律欢迎。
AutoGen 的流程不限于汽车。只要你有一款带 3D 模型的产品和一份营销日程,这场对话就值得花 20 分钟。
AutoGen 由 Ruse 合伙人 Adrian Van de Velde 开发,他是拥有 25 年片场经验的广告导演;Ruse 的每一个汽车广告项目都会用到 AutoGen。在 adrianvandevelde.com 了解 AutoGen 的更多信息。
本页所示 Geely EX2、EX5、EX5 EM-i、Starray、Starray EM-R 和 Coolray 产品仅作演示之用。所有商标均归各自所有者所有,仅用于展示 AutoGen 专有的虚拟汽车静帧与影片制作技术。AutoGen 与下列公司不存在任何关联,亦未获其认可,本页亦无此暗示:Zhejiang Geely Holding Group Co., Ltd.


