最新 Kimi K3 已上线大模型云服务,按量计费,稳定易用, 立即体验
共绩算力

把三个涂鸦少女”送出道”:一张定妆照 + 15 秒 PV 的 AI 偶像企划工作流

2026年8月26日
"把三个涂鸦少女”送出道”:一张定妆照 + 15 秒 PV 的 AI 偶像企划工作流"
Shiyuh
Shiyuh
技术传道者/AI 应用落地

先说一个玩 AI 视频的人都懂的痛:你脑子里有个角色,抽了四十条视频,没有两条里的”她”长得一样。今天粉色双马尾,明天就变成黑长直。AI 视频默认是”抽卡”——每一条都是重新掷骰,角色长相、画风、配色全凭运气。

我最近试出一套能治这病的路子,借一个真实的创作场景讲清楚:如果你要给一支”少女团体”做一支风格统一的 PV(宣传短片),怎么保证三个女孩从头到尾是同一个人、同一种画风?

答案是跟真实偶像企划学——先出定妆照(concept photo),再拍出道 PV(debut MV)。把”选角定设计”和”拍动态片”拆成两步,第一步用生图模型把角色锁死,第二步把这张图当成参考图喂给视频模型。下面这条 15 秒的 Y2K 少女手帐涂鸦风 PV,就是这么做出来的完整流程。

一、企划设定:GIRL CLUB 三人组

场景很简单:你要做一个 Y2K 美学向的账号(小红书 / 抖音 / 视频号都行),首发内容想是一支有记忆点的开场 PV——三位少女、手帐涂鸦画风、像 2000 年代少女杂志的开场片头。

三位主角的设定(后面全程不能变):

背景主色:明亮柠檬黄,点缀粉、青蓝、橙、白、黑。

记牢这个设定——整篇文章就是在讲”怎么让她们在三张图、一条视频里长得一模一样”。


二、STEP 1 · 定妆照:用生图把角色钉死

先别想视频。第一步的任务是出一张”团体定妆照”:三个少女的造型、画风、配色全部在这张图里确立,后面所有动态内容都以它为基准。

下面这条提示词可以直接复制去生图(平台上 Z-image qwen-image):

Y2K 2000 年代早期互联网少女涂鸦插画风,整体像青春手帐、DIY 贴纸册、独立漫画小志和早期个人主页插画。使用粗黑色不规则手绘线稿,线条轻微抖动、歪斜、带明显手工感,像马克笔、蜡笔和早期数位板随手绘制,保留 naive drawing、imperfect hand drawn linework、childish doodle 质感。
画面内容自由发挥,设计 2-3 名青春少女进行亲密互动,可以并肩合照、互相拥抱、拿相机拍照、聊天、吃零食、靠在一起或搞怪自拍,构图随性、不对称、有明显前后层次,不要整齐排排站。人物造型各不相同,发型、服装、配饰都具有 Y2K、Emo girl、Scene girl 气质,可以加入彩色发夹、吊带背心、水手领、条纹上衣、星星饰品、小相机、耳机等元素。
人物比例夸张可爱,大头、细脖子、窄肩膀,巨大的白色椭圆眼睛、小瞳孔、夸张长睫毛、小鼻子、小嘴巴,脸颊带大片粉红腮红,表情害羞、呆萌、甜蜜、搞怪,带一点青春期少女特有的古怪感。头发使用大面积扁平色块,轮廓可以尖锐、锯齿状,不表现写实发丝。
背景使用高饱和纯色,可以是芥末黄、亮粉、青绿、淡紫、橘红或天蓝,人物周围加入大量随手画的爱心、星星、和平符号、箭头、波浪线、闪电、小花、笑脸、几何图案、幻想气泡等涂鸦元素,部分图案可以从画框边缘自然裁切,形成拥挤但有节奏的青春手帐感。
整体使用荧光粉、紫色、青蓝、橘色、深蓝、黄色、浅粉等高饱和扁平配色,少阴影、少渐变、弱体积感,强调 flat colors、early internet art、teenage diary doodle、DIY zine、sticker book aesthetic、awkward cute girls。画面要可爱、古怪、青春、俏皮、叛逆又时髦。
不要写实,不要精致商业二次元,不要现代日漫高光大眼,不要 3D,不要电影感光影,不要厚涂,不要复杂阴影,不要写实发丝,不要完美线稿,不要光滑矢量感,不要高级时尚插画,不要 AI 塑料质感,不要文字、logo、水印、签名

这条提示词看着长,但它每句话都在干一件事。拆开看五个设计点,你以后写任何小众画风都能套:

  1. 用”美学体系标签”锚风格,而不是空喊风格名。光写”可爱插画”模型会给你它眼里最主流的可爱,也就是娟岛系商业甜美。这条里写的是 early internet artteenage diary doodleDIY zinesticker book aesthetic——这些是互联网美学社区里真实存在的标签,模型的训练语料里见过,一写就调出对应的视觉记忆,而不是泛化的”可爱”。
  2. 人物比例用”数值化描述”锁造型。 “大头、细脖子、窄肩膀、巨大的白色椭圆眼睛、小瞳孔”——比”可爱”稳定得多。比例词直接约束五官和头身比,模型不会跑偏成写实比例。
  3. 负面词清单一口气列 9 个”不要”。这是这条提示词最值钱的部分。AI 生图默认会滑向”精致商业二次元”或”光滑矢量感”,因为训练数据里这类占比最大。你不写”不要”,它大概率就给你那种。一口气把 不要写实 / 不要精致商业二次元 / 不要现代日漫高光大眼 / 不要3D / 不要厚涂 / 不要完美线稿 / 不要光滑矢量感 / 不要高级时尚插画 / 不要AI塑料质感 全列上,等于反向把小众画风圈死。这是抽小众美学最实用的技巧,没有之一。
  4. 构图给一个”拥挤感”指令。 “部分图案从画框边缘自然裁切,形成拥挤但有节奏的青春手帐感”——这句话决定了整体氛围是”贴满贴纸的手帐”而不是”干净留白的艺术插画”。很多教程只教写主体,忘了教写”空隙怎么填”。
  5. 互动场景给方向但不锁死。 “可以并肩合照、互相拥抱、拿相机拍照、搞怪自拍”是动作清单,给了模型随机发挥的范围,又不会让它画出三个人整齐排排站的证件照。

三、STEP 2 · 出道 PV:把母图喂给视频模型

定妆照定了,三个女孩的长相、发型、配色、画风全在这张图里了。下一步:把这张图作为参考图上传给视频模型,让它照着画风和小人儿去”演”一条 15 秒 PV。

为什么必须喂参考图?因为纯文生视频你又要重新描述一遍三个女孩长什么样,模型大概率给你三个”神似但不同人”的新角色。参考图模式(reference-to-video)的意义就是:角色长相和画风从图里来,提示词只管”她们在干嘛、镜头怎么走、节奏怎么卡”。

下面这条视频提示词可以直接复制(视频生成模型选 MiniMax H3,15 秒、720P):

参考上传图片的画风与角色气质,制作一条高识别度的 Y2K 少女手帐涂鸦风 PV / AE 大字报感动画。整体保持粗黑色手绘线稿、高饱和扁平色块、可爱古怪的少女感、早期互联网插画与贴纸手帐审美。三位女孩必须始终清晰、好看、可爱,造型与配色保持参考图风格:左侧粉发女孩拿相机,中间青蓝长发女孩戴耳机,右侧橙发卷发女孩拿彩虹棒棒糖。背景主色明亮柠檬黄,辅以粉色、青蓝、橙色、白色、黑色,点缀手绘爱心、星星、笑脸、波浪线、闪电、贴纸小图案。整体节奏轻快、俏皮、卡点强,像 2000 年代少女杂志开场、青春频道包装、手帐拼贴 PV。
【核心视觉发动机】"三人合照不断被贴纸、涂鸦、闪光灯和大字报侵入,最终从静态合照升级成疯狂跳动的 Y2K 少女手帐世界。"人物动作不要太复杂,以眨眼、歪头、举相机、耳机轻弹、棒棒糖旋转、手势变化为主;炫技重点放在贴纸弹出、手绘元素生长、画面撕贴、闪光、色块切换、构图重组和大字报卡点上。
【镜头与时间轴】
0-2 秒:纯黄色背景上,手绘爱心、星星、波浪线啪地弹出;三位女孩以"拍立得合照"方式快速出现,先局部后完整,配合相机闪光,最后定格成三人近距离合照,第一秒就抓眼。
2-5 秒:快速切三人角色特写。粉发女孩举起相机对镜头拍照,镜头瞬间过曝闪白;切到青蓝长发女孩正面特写,耳机轻轻弹动,头发小幅摆动;切到橙发女孩舔彩虹棒棒糖,棒棒糖旋转。期间穿插手绘大字报短词,如"SNAP!"、"SWEET!"、"GIRL CLUB!",字体像贴纸和杂志标题,充满 Y2K 感。
5-8 秒:三人重新同框,背景色在黄、粉、青蓝之间快速切换,爱心、笑脸、星星、闪电不断跳出并贴满画面,人物轻微晃动、眨眼、互相靠近,构图像朋友自拍和青春贴纸本。
8-11 秒:进入视觉高潮,画面突然黑场 0.2 秒,只剩三双夸张黑白大眼睛浮现;下一拍黄色背景爆开,三位女孩以更夸张的拼贴构图重新出现,贴纸、拍立得边框、手绘线条和爱心疯狂堆叠,形成杂志拼贴般的爆发感。
11-13 秒:节奏短暂停顿,恢复较完整的三人合照,人物只做轻微动作:眨眼、歪头、棒棒糖转动、相机闪一下、耳机晃动,背景小爱心和笑脸缓慢漂浮,制造可爱的停顿。
13-15 秒:最终爆点,相机"咔嚓"一声,整张合照冻结成一张拍立得照片并快速缩小,周围同时飞出大量同风格贴纸、涂鸦、爱心、星星和小照片,最后组成一整面 Y2K 少女手帐墙,中央仍是三人主合照,画面以一个超大粉色爱心或星星贴纸盖满镜头结束。
【风格要求】始终保持参考图那种稚拙、手绘、不完美但极有个性的线条与上色方式;人物五官、眼睛画法、腮红、头发块面、配色都要接近参考风格。整体偏 2D 平面动画 + MG + 拼贴 AE 感,不要写实,不要复杂三维运镜,不要电影感,不要厚涂,不要过多写实光影,不要高精 3D 建模感,不要让人物变成现代精致商业二次元。音乐气质为轻快 Y2K pop、electro pop、bubblegum pop,带相机快门、贴纸弹出、闪光和电子卡点音效。最终成片必须可爱、怪趣、时髦、青春、抓眼,像一支真正的少女潮流 PV。

这条视频提示词比生图提示词长得多,但长有长的道理——它在替模型”分镜”。拆开看六个设计点:

  1. 15 秒切成 6 段,每段一个节拍。0-2 / 2-5 / 5-8 / 8-11 / 11-13 / 13-15。秒级时间轴是 MiniMax H3 的强项,你写”第几秒干什么”,它基本按表执行。别把 15 秒写成一段笼统描述,那等于把节奏交还给运气。
  2. 开场两秒定律。 “第一秒就抓眼”不是口号——0-2 秒设计了拍立得快速出现 + 相机闪光定格,信息密度拉满。短视频前 2 秒留不住人,后面再好也白搭。
  3. 动作预算理论:人动得越少,画面越稳。这条里专门写了”人物动作不要太复杂,以眨眼、歪头、举相机为主;炫技重点放在贴纸弹出、色块切换、大字报卡点上”。这是实战血泪:AI 视频里最贵的不是特效,是”让一个人自然地动”。你让人物做大动作(跳舞、奔跑、复杂手势),模型容易变形崩坏;你把动效预算让给贴纸、闪光、色块切换这些”画面元素动”,人物只做微表情,成片反而又稳又炸。
  4. 8-11 秒用”黑场 + 大眼睛”制造节奏对比。前面一直热闹,这里突然黑场 0.2 秒只留三双大眼睛,下一拍黄色爆开——停顿和爆发交替才是”卡点感”的来源。全程高频刺激反而会疲劳,高潮段需要前面有蓄力。
  5. 首尾闭环叙事。开头是”合照快速出现”,结尾是”合照冻结成拍立得 + 缩小成手帐墙”。从合照来、回合照去,观众潜意识里觉得”这支片讲完了”。很多 AI 视频结尾是凭空淡出,少了这口气。
  6. 声音分三层,这就是音画一体的意义。 “相机快门、贴纸弹出、闪光”是画面里真实发生的音效(diegetic),”Y2K pop / electro pop / bubblegum pop”是背景音乐(non-diegetic)。H3 是音画一体模型,你把这些写进提示词,生成时 BGM 和音效直接带着,不用后期再配。这条专门写了”带相机快门、贴纸弹出、闪光和电子卡点音效”——卡点音效和画面爆点对齐,爽感翻倍。

四、进阶:把提示词写成”模型听得懂的分镜表”

上面的视频提示词是中文自由描述,小白直接复制就能用。但 H3 官方给了一套结构化提示词规范,深度玩家写成那样执行度更高。核心就三个字段:

把上面那条提示词”翻译”成骨架,大概长这样(英文写、字段名固定,模型遵循度更稳):

integrated_multimodal_description: [Shot 1] 2D-animated Y2K diary-doodle style, flat colors, bold wobbly black outlines. A bright lemon-yellow background. Three girls appear like instant polaroids, partial then complete, with a camera flash; they settle into a close group photo. Pink-haired girl holds a camera, teal-long-haired girl wears headphones, orange-curly girl holds a rainbow lollipop. Hand-drawn hearts, stars, squiggles pop in. [Shot 2] At 00:02.000, quick cuts to each girl: pink-haired raises camera, lens flares white; teal-haired headphone bounces, hair sways; orange-curly licks lollipop, it spins. Sticker-title words "SNAP!" "SWEET!" "GIRL CLUB!" flash on screen. ... (后续按 5/8/11/13 秒节点续写)
overall_soundscape: Crisp camera shutter clicks, sticker-pop sounds, soft paper rustle and giggles throughout; a low electronic hum under the beats.
non_diegetic_music: Upbeat Y2K bubblegum pop, electro beat with snappy kick on each cut, bright synth melody, no orchestral swell.

注意字段名必须原样写(integrated_multimodal_description 等),这是 H3 被设计成”听指挥”的原因——你按它的格式交分镜表,它按表拍。这是从”抽卡”跨到”执导”的关键一步。参考图模式还有更完整的六段式(多一个 subject_definitions 把参考图里的角色单独定义出来追踪一致性),深度玩家可以去翻官方规范,这里不展开。


五、这支 PV 到底考了 H3 哪几项能力

不是所有视频模型都能扛住上面这条。对照一下,你就知道它考了什么:

能力项

这条 PV 怎么考

为什么重要

参考图一致性

母图定角色,视频全程三人不变脸

AI 视频最大痛点,没这能力前面全白搭

秒级时间轴执行

6 段分镜按 0/2/5/8/11/13 秒节点走

能”执导”而不是”抽卡”的分水岭

风格锁定

2D 平面 + MG + 拼贴,不滑向 3D

小众美学最怕被模型”修正”成主流

音画一体

快门/贴纸音效 + Y2K BGM 一次生成

省掉后期配音配乐

文字渲染

大字报“SNAP! / GIRL CLUB!”

⚠️ 弱项,见下方翻车提示

翻车点诚实说:画面里的文字(大字报短词)是视频模型普遍弱项,可能乱码。原文写了“SNAP! / SWEET! / GIRL CLUB!“,如果生成出来是乱码方块,两个解法:① 把这几个词从提示词里删掉,后期自己用剪辑软件盖字幕(最简单);② 重抽一两次碰运气。别为了几个字卡住整条片。


六、角色资产化:一套定妆,N 条内容

这套工作流最值钱的地方不是”做了一条 PV”,是”你拥有了一组固定角色”。那张母图就是你的角色资产,后面不用再重新抽卡。三条现成的续集提示词直接拿去用——上传的还是同一张母图,只换提示词:

续集 A · 房间自拍 vlog(日常涨粉款)

参考上传图片的画风与角色气质,制作一条 Y2K 少女手帐涂鸦风的日常 vlog 动画。三位女孩(左侧粉发拿相机、中间青蓝长发戴耳机、右侧橙发卷发拿棒棒糖)在贴满贴纸的少女房间里挤在一张床上玩自拍。节奏轻快日常:粉发女孩举手机发起自拍,三人先是比耶,然后青蓝女孩突然凑近镜头做鬼脸,橙发女孩笑着躲开,最后手机定格在三人挤成一团的搞怪合照上。背景薄荷绿,点缀手绘爱心、星星、小花、零食图案。人物动作简单:比耶、凑近、歪头、眨眼,动效交给背景贴纸弹跳和色块切换。音乐为轻快 lo-fi pop,带手机快门声、床垫弹跳声、女孩们咯咯笑声。保持粗黑手绘线稿与扁平色块,不要写实,不要 3D。

0 (3).mp4

续集 B · 圣诞特别版(节日流量款)

参考上传图片的画风与角色气质,制作一条 Y2K 少女手帐涂鸦风的圣诞特别动画。三位女孩(粉发相机女孩、青蓝长发耳机女孩、橙发卷发棒棒糖女孩)戴圣诞帽、围红围巾在雪夜里交换礼物。开场红色背景雪花飘落,礼物盒啪地弹出;三人轮流拆礼物——粉发女孩拆出迷你相机、青蓝女孩拆出星星耳机、橙发女孩拆出巨型棒棒糖,每拆一件配一次闪光和手绘"HO HO HO!"字样弹出;结尾三人举起礼物合影,画面冻结成拍立得,四周飞满雪人、驯鹿、拐杖糖贴纸。人物只做拆礼物、举礼物、惊喜瞪眼的简单动作。音乐为俏皮的 jingle bells 电子 remix 版,带撕包装纸声、铃铛声。保持手绘线稿与扁平色块,不要写实 3D。

续集 C · 换季 outfit 秀(人设深化款)

参考上传图片的画风与角色气质,制作一条 Y2K 少女手帐涂鸦风的秋冬换装秀动画。三位女孩(保持原有发型与配饰:粉发 + 相机、青蓝长发 + 耳机、橙发卷发 + 棒棒糖)从夏日吊带装瞬间切换到 oversized 针织毛衣、格纹围巾秋冬造型。开场柠檬黄背景,三人穿夏装定格;一道手绘闪电劈下,背景切换成暖橘色,三人服装"啪啪啪"逐个切换,每切一次配一个手绘箭头和闪光;结尾三人穿着毛衣互相依偎着喝热可可,头顶飘出爱心形状的热气。人物动作只有转身、展示衣服、依偎,其余交给贴纸弹跳。音乐为温暖的 synth pop,带毛绒摩擦声、吹热可可声。保持粗黑手绘线稿与扁平色块画风,不要写实,不要 3D。

0 (5).mp4

看到规律了吗?三条续集全是同一个公式:角色锚点不变(发型 + 标志物)+ 场景动作换新 + 动效预算继续给贴纸色块。这就是角色资产的意思——你不是在写新提示词,是在给同一组角色安排新剧本。

准备好开始您的 AI 之旅了吗?

读完这篇文章,想必您对 AI 技术有了更深的了解。现在就来体验共绩算力,让您的想法快速变成现实。

✓ 已有 10 万 + 开发者在使用

✓ 99.9% 服务可用性

✓ 开箱即用的容器托管