- 写AI视频提示词前要先决定什么?
- 怎么把一个想法写成可执行的AI视频Prompt?
- AI视频提示词公式:6个核心要素
- 文生视频、图生视频提示词怎么写?
- AI视频提示词案例:把模糊需求改成完整指令
- AI视频生成结果不符合预期怎么修改?
- AI视频提示词不会写?使用GenApe提示词助手
在AI视频生成工具里输入一句话,结果出来的是一个几乎静止的模糊画面—这种情况大多数人都遇到过。问题不在于工具,在于提示词缺少AI真正需要的信息。
AI视频提示词跟图片提示词有一个根本区别:视频有时间轴。你需要告诉AI画面从哪里开始、中间发生什么、镜头怎么运动、最后停在哪里。把这几点交代清楚,ai视频生成的质量会有明显提升。
这篇文章从写提示词之前要先想清楚的3件事开始,介绍一套可以复用的6要素公式,配上4种常见视频类型的改写案例,以及生成结果不符合预期时的修改思路。
写AI视频提示词前要先决定什么?

直接动手写提示词很诱人,但有3个问题没想清楚之前,ai生成视频的结果多半要返工。先解决这3件事,再写提示词。
确认视频用途和发布平台
视频发布在哪里,几乎决定了它在节奏、构图和视觉风格上的所有需求。同一个内容主题,用来做品牌官网的展示视频和用来做抖音短视频,节奏、景别、字幕位置的要求完全不同。
写提示词之前先问自己两个问题:这个视频要让观众做什么?他们会在哪里看到它?视频的平台和用途决定了提示词里应该强调什么,放在后期制作阶段再考虑这些往往已经太晚。
选择文生视频、图生视频或首尾帧生成
主流AI视频生成工具—Runway、可灵(Kling)、Sora、即梦—都支持三种输入模式,每种模式对提示词的要求完全不同。
文字生成视频是从零开始,AI没有任何视觉参考,全部画面信息都要靠提示词提供。主体外观、场景细节、动作方式、镜头运动、视觉风格,一个都不能省。
图片生成视频是上传一张图片作为起始帧。画面的主体、场景和视觉风格已经确定,提示词的重心转移到动作和运镜上:什么在动、怎么动、镜头往哪里走。重新描述图片里已经有的视觉信息,反而会让AI产生困惑。
首尾帧生成是同时提供开场画面和结束画面,AI负责生成中间的过渡。提示词要描述的是转换的逻辑:什么样的运动连接了两个画面、速度是快是慢、过渡是流畅的还是有节奏感的。
先确定用哪种模式,再写提示词,可以避免写了半天才发现方向搞错了。
设置画面比例、视频时长和输出要求
这几个参数容易被忽略,但在ai做视频之前就应该确定:
画面比例:16:9用于横版内容(YouTube、官网展示),9:16用于竖版短视频(抖音、Reels、视频号),1:1用于部分信息流场景
视频时长:大多数ai视频生成器单次生成上限在5到10秒,需要更长的视频要分段生成再剪辑拼接
输出分辨率:确认工具是否支持1080p或4K,不同规格可能影响积分消耗或生成时间
这些参数大部分在工具界面里设置,不一定要写进提示词,但提前确定好可以避免生成出来的格式不对用。
怎么把一个想法写成可执行的AI视频Prompt?
AI视频沿着时间轴展开,有开始、有中间、有结束。按照这条时间线来构建提示词,而不是描述一张静止的图片,是让ai制作视频真正有动感的关键。
描述视频开始时的画面
开场画面是整段视频的视觉基础。AI会从这里出发,建立后续所有内容的逻辑。描述要够具体:主体在哪个位置、处于什么状态、周围环境是什么、光线从哪里来、镜头是什么景别。
「一瓶护肤精华竖立在白色大理石桌面上,45度侧面中景,柔和的棚灯从左上方打来,背景浅白带渐变阴影」,给了AI足够的视觉基础。「一瓶精华」什么都没给。
说明主体产生的动作和变化
这是提示词里最常被忽略或写得最含糊的部分。如果你不说明什么东西在动,AI很可能生成一个几乎没有运动的精致静态画面,这通常不是你想要的结果。
动作描述要具体到方向和速度:「人物从左向右走过画面」「一滴液体从滴管顶部缓缓落下」「蒸汽从杯口慢慢升起并扩散」。速度感也很重要,「缓缓」「快速」「在整个视频过程中逐渐」都会影响最终画面的节奏。
指定镜头如何观察或跟随主体
镜头运动是独立于主体动作的另一个维度,两者可以同时发生也可以单独出现。常见的运镜方式:
推镜头/向前推进:镜头靠近主体,产生聚焦感或紧张感
拉镜头/向后拉远:镜头远离,展现更大的环境或制造画面呼吸感
横移/平移:水平扫过,适合跟随横向运动或展示空间
摇镜头(仰摇/俯摇):垂直方向移动,适合展示高度或向下确立场景
跟随镜头:镜头跟着运动中的主体移动
环绕/弧形运动:镜头围绕主体转圈,常用于产品展示或英雄时刻
如果不指定运镜,AI会自行决定,默认往往是几乎静止的锁定镜头,不一定符合你的需求。
描述视频最后停在哪个画面
告诉AI你希望视频结束在什么画面,可以帮助它反向规划中间的运动过程。不需要很复杂,「视频结束时镜头已拉远到全景,主体站在画面中央」这样的描述就够了。
部分工具支持首尾帧生成模式,直接用图片指定结束画面,比用文字描述更可靠。如果结束画面的准确性对你的项目很重要,值得考虑用这个模式。
添加不能改变的画面限制
告诉AI什么不能出现,和告诉它要出现什么一样重要。这就是负面提示词(negative prompt)的作用—列出你想排除的元素或不希望发生的情况。
常见的质量类排除:模糊,低画质,水印,过曝,颗粒感
常见的人物类排除:手指变形,手部扭曲,面部模糊,服装前后不一致
常见的场景类排除:不要出现多余人物,不要有背景文字,不要出现镜头切换
大多数工具都有单独的负面提示词输入框,记得用上。这是减少意外情况最直接有效的方式之一。
AI视频提示词公式:6个核心要素

一条完整的ai视频提示词需要覆盖6个要素。不是每个项目都需要把6个要素写得同样详细—一个简单的循环动画和一条电影感产品视频的侧重点完全不同—但了解每个要素的作用,可以让你有意识地决定哪些详写、哪些省略。
公式:画面主体 + 动作变化 + 场景环境 + 镜头语言 + 视觉风格 + 技术控制
画面主体:视频中出现谁或什么
画面主体是视频的核心视觉焦点,可以是人物、产品、动物、建筑或任何你想展示的对象。描述要详细到让AI能建立一致的视觉印象:外观特征、大小、颜色、在画面中的位置,以及任何需要保持不变的关键细节。
主体需要在整个视频里保持视觉一致性时(尤其是人脸和手部),描述越具体越好。模糊的主体描述会导致画面漂移—随着镜头角度变化,主体的外观会发生细微变化,这种情况在后期很难修复。
动作变化:主体如何移动
描述可见的运动:主体做了什么、速度快还是慢、朝哪个方向。如果背景也有运动(风吹树叶、人群流动、水面波纹),同样需要描述—它不会自动发生。
具体的动作描述往往效果更好:「稳稳地朝镜头方向走来」「缓缓将头向上仰」「液体以连续不断的细流倒下」「蒸汽向上飘散后逐渐消散」。避免描述内心状态或抽象动词,AI按字面意思理解提示词,不知道「充满活力」或「散发能量」长什么样。
场景环境:动作发生在哪里
场景涵盖地点、时间段、天气以及围绕主体的环境细节。描述越具体,AI自行发挥的空间就越小,这通常是你希望的结果。
「一间现代咖啡厅」是个起点。「一间小型日式风格咖啡吧,暖色吊灯,裸露的水泥墙,磨砂落地窗,傍晚时分」是一个场景。第二个描述给了AI更少的解读空间,也给了它更多可以渲染的内容。
镜头语言:景别、角度和运镜方式
镜头语言是提示词里杠杆效应最强的要素之一。同样的主体和动作,从低角度拍摄和从俯视角度拍摄,配上慢推镜头和固定锁定镜头,给人的感受可以完全不同。
景别从小到大:极特写→特写→中近景→中景→全景→大全景。拍摄角度包括:平视、仰拍(向上看主体)、俯拍(向下看主体)、鸟瞰(垂直向下)。运镜方式参考上一节的列表。
这三个维度不需要在每条提示词里都用到,但如果镜头感对视频的表现力很重要,就明确写出来,而不是把它交给AI自行决定。
视觉风格:光线、色彩和画面氛围
这是视频「长什么样」的部分。光线描述词如「黄金时刻暖光」「冷蓝色夜景」「强硬的顶光」「柔和的漫射棚光」告诉AI如何构建场景的情绪。色彩基调词如「去饱和的大地色系」「高对比霓虹色」「清透冷白」快速塑造整体画面感。
整体风格上,描述感受比直接引用影片名字效果更好—「电影感浅景深」「纪录片手持风格」「干净的商业美学」「梦幻柔焦」都比「拍得像某部电影」更容易让AI准确理解。
技术控制:比例、时长、声音和限制条件
这个要素涵盖所有偏技术性的参数。如果工具支持,可以指定:
时长:「5秒片段」或「生成约8秒的视频」
负面提示词:在专用输入框填写,或在主提示词里加「避免……」「不要出现……」
特效:运动模糊、镜头眩光、胶片颗粒感、景深效果
音频提示:部分新工具(如可灵3.0的原生音频)支持同步添加声音描述
技术控制要素的作用是给视频做最后一层修整——补充那些让生成结果更干净、防止它往不想要方向跑偏的细节。
文生视频、图生视频提示词怎么写?
同一个视频创意,在不同生成模式下,提示词的侧重点完全不同。
文字生成视频:交代完整画面信息
文字生成视频时,AI没有任何视觉参考,所以需要覆盖全部6个要素,每个都要有足够的细节,不给AI猜测的空间。
这不代表要写一篇长文章。一条结构清晰的80字提示词通常比一段模糊的200字描述效果更好。按视觉重要性排序,最关键的信息放在最前面—大多数模型对提示词开头的权重更高,关键细节放到最后容易被弱化。
一个实用技巧:先写主体和动作,再补充场景、镜头和风格,最后加入技术控制和负面提示词。这个顺序跟大多数AI视频模型处理信息的权重基本一致。
图片生成视频:重点描述动作和运镜
上传参考图片后,主体外观、场景和视觉风格已经确定,提示词只需要告诉AI两件事:什么东西在动,以及镜头怎么走。
重新描述图片里已经有的视觉内容—「图中的人物穿着蓝色外套,背景是木质桌面……」—通常会让模型产生困惑而不是帮助它。直接跳过视觉描述,把重心放在动作上:「蒸汽从杯口缓缓升起,镜头轻柔地向前推进,焦点落在咖啡液面上」。
如果有一处需要改变、其他地方要保持不动,两个条件都要说清楚:「蜡烛火焰轻轻摇曳,其他所有元素保持静止」。
首尾帧生成视频:说明两张画面的转换过程
提供开场和结束两张图片后,提示词要描述这段路径的逻辑:什么样的运动连接了两个状态、过渡发生得快还是慢、路径是流畅的还是有节奏感的。
生成之前最值得检查的一件事:两张图的视觉连贯性—光线方向、色温、场景规模,要有足够的相似度,让过渡看起来合理。如果起始帧是暖光近景、结束帧是冷蓝广角,不管提示词写得多好,AI都很难生成自然的过渡。如果两张图差距比较大,在提示词里说明过渡逻辑(比如「结合缓慢淡入和镜头拉远的组合」)可以帮助AI弥补差距。
AI视频提示词案例:把模糊需求改成完整指令

对比改写前后的提示词是理解「什么有效」最快的方法。下面是4种常见视频类型的改写示例。
产品展示视频提示词案例
模糊版本:一段护肤精华的广告视频。
优化后版本: 「一瓶小型玻璃精华液放在白色大理石桌面上,从45度侧面中景拍摄。一滴液体在滴管顶端慢慢成形,随后以慢动作落入下方静止的水面,激起柔和涟漪。镜头缓缓向液滴落点推进。光线柔和,来自左上方,有微微暖光晕。背景干净白色,带轻微渐变阴影。风格:高端美妆广告,浅景深。不要出现手部,不要有文字入镜。」
人物动作视频提示词案例
模糊版本:一个男人在夜晚城市里行走。
优化后版本: 「一位30多岁的男性,穿深色大衣,沿湿润的城市人行道从画面左侧走向右侧,步伐稳定。镜头跟随他以中景高度平行跟拍,保持匀速。霓虹招牌和路灯的光线倒映在湿润的路面上。背景是焦外的行人和经过的车灯。氛围:沉静、电影感,略带忧郁。色调:深蓝和琥珀色。不要出现镜头切换。」
美食广告视频提示词案例
模糊版本:一条放在Instagram上的意面视频。
优化后版本: 「一碗刚摆盘的培根蛋黄意面放在深色石板上。蒸汽从面条表面缓缓升起,同时一只手以缓慢的旋转动作用叉子挑起一叉面——镜头跟随叉子从中景向下推进到特写,紧贴着叉子离开碗的过程。右侧暖光侧打,在面条表面形成金色光泽。背景是虚化的厨房环境。氛围:丰盛、触感强。风格:高端美食编辑,暖色调。」
社交短视频提示词案例
模糊版本:一条生活方式类视频号短视频。
优化后版本: 「以一只陶瓷马克杯被轻轻放上木质桌面的极特写开场。镜头缓缓向后拉远,逐渐展现一个人坐在宽大的落地窗旁,双手捧着杯子,窗外是清晨的城市屋顶,玻璃上有雨痕。手持镜头感,轻微晃动。色调:冷蓝与来自马克杯的柔暖琥珀色交织。时长约6秒,9:16竖版。风格:安静生活,纪录片质感。」
AI视频生成结果不符合预期怎么修改?
提示词写得再好,也不一定每次都能一次生成到位。下面是最常见的几类问题,以及通常有效的修改方向。
视频几乎没有动作
这是最常见的问题。AI生成了一张精美的「会动的图片」,画面几乎没有真实的运动感。
原因:提示词描述了视觉场景,但没有包含明确的动作语言。没有运动指令,很多模型默认输出接近静止的画面。
修改方向:加入带有节奏感的具体动作动词。「蒸汽缓缓升起」「人物朝镜头走来」「镜头用5秒的时间缓慢推进」—这些给了模型可以动起来的依据。如果工具有运动强度滑块,也可以同步调高。
人物动作出现变形
手臂以奇怪的角度弯折,手指数量不对,面部在运动中模糊—人物动作仍然是当前AI视频模型最难处理的部分之一。
原因:复杂动作、多人互动和手部细节超出了当前大多数模型的稳定处理范围。
修改方向:简化动作。把「厨师快速切菜」改成「厨师站在操作台旁,双手做缓慢的稳定动作」。把每次生成的动作限制在单一方向或单一运动上。除非工具明确支持,否则避免手部特写。
运镜幅度超出预期
你要了「轻微推镜」,结果AI给了一个令人头晕的急推。
原因:「推镜」「缩放」这类词本身不带速度信息,模型自行判断了幅度。
修改方向:加入程度修饰词:「非常缓慢地」「轻微的」「几乎察觉不到的漂移」「贯穿整个视频过程」。也可以用起点和终点锚定范围:「从中景开始,结束时刚好进入中近景范围」比「推镜头」精确得多。
场景突然发生切换
视频在同一场景里突然跳切到另一个完全不同的地方。
原因:提示词里出现了多个地点或环境描述,被模型理解成了场景切换,而不是一个连续场景。
修改方向:每次生成只描述一个场景。如果视频概念需要多个地点,分开生成再后期拼接。同时避免在文生视频提示词里使用「然后」「接着」「随后」,这些词会被模型理解为切换信号。
主体外观前后不一致
人物在视频开头和结尾长得不太一样—发型、面孔或服装发生了细微变化。
原因:随着镜头角度变化或视频时长增加,模型在保持主体视觉一致性上会出现偏差,时长较长的片段尤其明显。
修改方向:让运动弧度保持简单—主体主要朝一个方向移动(而不是转向面对新角度)会保持得更稳定。在提示词里重点强调最显著的外观特征:「全程保持人物的红色外套和深色短发」。如果工具支持图片或角色参考,用上它,效果比纯文字描述可靠得多。
视频没有停在指定画面
结束帧跟描述的完全不一样。
原因:大多数文生视频模型不把结束帧描述当成硬约束,而是当成大致方向,结束帧是连续生成流程的一部分,并不会被锁定。
修改方向:如果工具支持首尾帧模式,切换过去用—这是控制结束画面最可靠的方式。如果只能用文生视频,把结束帧的描述放到提示词靠前的位置,而不是末尾,因为模型对提示词开头权重更高。或者考虑生成第二段视频,以第一段结束的地方为起点,再后期拼接。
AI视频提示词不会写?使用GenApe提示词助手

从头写一条完整的结构化提示词需要练习,在快速生产内容或需要跨多种视频格式切换时,这个过程会成为效率瓶颈。GenApe的ai视频提示词助手就是为这个场景设计的。
用你自己的话描述视频创意,GenApe会根据你使用的AI视频工具生成一条完整的结构化提示词,覆盖画面主体、动作、镜头语言、视觉风格和技术控制,不需要你记住每一个术语和公式格式。同时提供按视频类型分类的提示词模板,不管是产品展示、社交短视频还是电影感场景,都可以从一个已经搭建好的结构开始,而不是面对空白输入框从零开始。
相关文章

AI 旅游绘本制作全攻略|提示词+生成流程一次学会
想用 AI 制作自己的旅游图吗?这篇文章带你从零开始,学会提示词使用、风格选择,以及生成流程,最后还能让你的旅游图动起来!
最后更新: 2026/06/22

AI会议记录神器怎么选?这9款会议纪录AI工具一次看!
你还在花大量时间手动记录会议内容并整理摘要吗?是时候考虑使用AI会议记录工具来提升工作效率了!
随著AI技术的发展,你可以轻松告别繁琐的手动记录,利用先进的会议记录神器,迅速生成精确的会议逐字稿和摘要,让会议后勤工作变得更有效率。
在这篇文章中,我们会介绍10款功能强大的会议记录软体,这些AI工具能轻松转录语音,也能快速提炼出会议中的重要内容,让你终于不用再为整理会议记录而头痛。
最后更新: 2025/07/18

自传怎么写?5个自传产生器快速生成优质自传
随著AI产业的蓬勃发展,许多人开始使用AI写自传。自传产生器更是专为自传生成而设计的,透过自传产生器500字短文随即生成。GenApe今天将教你自传该如何撰写,以及推荐5个好用的自传生成器。
最后更新: 2026/06/23

