封面是整条内容里性价比最高的一处投入。
同样一条视频,换个封面点击率能差两三倍。但人工做封面又是最枯燥的活——尺寸多、数量大、改起来烦。所以这块很适合交给生成,前提是提示词得写对。

一、提示词要分三层写
很多人写提示词是一整段话从头写到尾,每次重新想。这样既不稳定,也累。
正确做法是拆成三层,只有中间一层每次换:
固定层(永远不变)
品牌色、整体风格、画质要求、构图偏好。这部分写成常量,每次自动带上。
例:明亮通透的商业摄影风格、蓝色为主色调、柔和自然光、浅景深、高细节、8K 画质
变量层(每次换)
主体物、场景、情绪、核心信息。这部分是每篇内容的差异所在。
例:便携榨汁杯 / 办公室桌面 / 清爽活力 / 静音
约束层(永远不变)
必须排除的东西。这一层最容易被忽略,也最决定成败。
例:不要文字、不要水印、不要 Logo、不要签名、不要变形的手部
三层分开之后,每次只需要写中间那 20 个字。
二、让结果稳定的三个约束写法
第一,明确排除,而不是只说要什么。
「极简风格」是无效描述,模型理解成什么都有可能。改成「纯色背景、单一主体、无装饰元素、无文字」,结果才收敛。
我们的固定约束里有一条是硬性的:不要文字。 生成模型处理文字的能力很不稳定,出来的字经常是乱码或者拼错。封面上的文字应该后期加,不要指望生成。
第二,指定负面清单,且放在提示词靠后位置。
约束写在开头容易被主体描述稀释,放在最后权重更高。我们测试过同一组提示词,约束在开头和结尾的合规率差了约 40%。
第三,给尺寸和构图,不给模糊的审美词。
「好看的构图」没用,「主体居中、占据画面 60%、上方留白 20%」有用。社媒封面有明确的尺寸要求(比如 16:9 用于横版,9:16 用于竖版),这些必须写死。

三、一套可以直接抄的模板
[固定层]
明亮通透的商业摄影风格,蓝色为主色调,柔和自然光,
浅景深虚化背景,高细节,8K 画质,主体居中占画面 60%,
上方留白 20%
[变量层]
主体:{产品名称与外观描述}
场景:{使用场景}
情绪:{希望传达的感觉}
[约束层]
纯色背景,无装饰元素,画面干净
不要文字,不要水印,不要 Logo,不要签名,
不要变形的手部,不要多余的人物
把固定层和约束层存成模板,每次只填变量层的三项。
四、不同平台的封面差异
| 平台 | 尺寸 | 封面要点 |
|---|---|---|
| 抖音 | 9:16 | 竖构图,主体靠上,底部留给文案 |
| 小红书 | 3:4 | 主体居中,可加少量留白做文字区 |
| 视频号 | 9:16 | 与抖音类似,注意右侧按钮区 |
| TikTok | 9:16 | 顶部留空间给平台 UI |
| 横版封面 | 16:9 | 主体偏左或偏右,另一侧留标题区 |
小红书的封面尤其值得多花时间。 这个平台的封面几乎决定了笔记的点击率,而且是搜索结果里最显眼的元素。
五、注意事项
- 约束层放在提示词最后:实测合规率差 40%
- 不要指望生成文字:出来的字经常是乱码,文字后期加
- 固定层和约束层存成模板:每次只填变量层
- 面向欧盟市场的生成图必须标注:AI 生成的产品图和场景图属于必须显式标识的范畴
- 生成十张挑一张:不要拿第一张就用,挑选的成本远低于返工
FAQ
Q:生成的图能直接商用吗?
风格上可以,但要过两道关:一是合规标注(面向欧盟必须标),二是检查有没有意外生成类似品牌标识的元素。
Q:每次生成多少张合适?
我们是一次生成 8-10 张,挑 1 张。挑的时间大概 2 分钟,比反复改提示词重生成快。
Q:为什么我生成的图总是不稳定?
大概率是约束层缺失或者位置不对。只有正向描述没有负面约束,结果必然发散。
Q:封面需要每个平台单独做吗?
至少需要横版和竖版两套。同一个构图改尺寸会裁掉关键部分,不如重新生成。