如何把一张照片变成 AI 视频(分步教程)
SnowArt Team
7/15/2026

文生视频要求模型凭空创造一切。图生视频则好控制得多:**你的照片决定画面长什么样,提示词只需要决定画面怎么动。**正是这种分工,让图生视频成为做出像样 AI 视频最快的路径。
工作流
1. 选对原始图片
模型只会让它看到的东西动起来,所以图片质量就是视频质量的上限。以下几点很关键:
- 主体清晰单一 —— 一个人、一件产品、一只生物。拥挤的场景会迫使模型分散注意力。
- 留出运动空间 —— 动作进行到一半的主体,比僵硬的正面姿势动起来自然得多。
- 边缘干净 —— 运动会放大压缩噪点,所以从你手上最清晰的版本开始。
AI 生成的图片和照片一样好用。一条常见的流水线:先在图片生成器里做出完美的一帧,再让它动起来。
2. 描述运动,而不是场景
模型已经看到了场景——再复述一遍就是浪费提示词。只描述应该发生变化的部分:
~~"A woman in a red coat standing on a bridge in the rain"(一位穿红大衣的女子雨中站在桥上)~~
"She turns her head toward the camera and smiles; rain intensifies; slow push-in."(她转头看向镜头并微笑;雨势加大;镜头缓慢推进。)
值得分别写清的三层运动:主体运动(主体在做什么)、环境运动(雨、蒸汽、人流)、镜头运动(推进、环绕、手持晃动)。
3. 选时长和分辨率
先用 480p 生成一段短片,确认运动效果是否符合预期——渲染快,花费也最少。运动对了之后,再用同一条提示词跑 720p 或更高。第一次尝试就上最高画质,是浪费积分最常见的方式。
4. 生成并迭代
视频异步渲染,完成后会出现在你的历史记录里。如果某次生成失败,那一次的积分会自动退还。迭代方法和做图一样:每次只改一处。
三种常见翻车情况的修复
主体扭曲或"融化"。 通常是提示词塞太满了。删到只剩一个明确的动作。带参考帧控制的高级模型(如 Seedance 2.0)保持主体一致性的能力最强。
所有东西都动得太厉害。 模型天生偏爱夸张。加上 "subtle motion"(细微运动)或 "slow, gentle movement"(缓慢轻柔的运动)——明确要求少动是有效的。
镜头乱动。 就算你不想要任何镜头运动,也要明确写出来:"static camera"(固定镜头)或 "locked shot"(锁定机位)可以防止意外的平移。
该用哪个模型
SnowArt Video 是最好的起点——5 秒短片生成快、积分消耗最低,适合摸清提示词的效果。当你需要更长的片段、更高的分辨率、音频或首尾帧控制时,高级阵容(Seedance 2.0、Kling 3.0、Veo 3.1)都包含在付费方案里。