ComfyUI 人群视频工作流:控制人物、运动与遮挡

E
Emma Chen·1 min read·Sep 13, 2026
Share on X
ComfyUI 人群视频工作流:控制人物、运动与遮挡

AI 概览

什么是最安全的 ComfyUI 人群视频工作流?

先构建一个已批准的人群静态图,将主角与背景人群分离开来,添加深度或姿态引导,再生成一段短镜头。仅当人物身份、行进路径及遮挡关系均保持稳定后,才逐步增强人群运动。

如何在 ComfyUI 中保持多人物的一致性?

为每位重要人物赋予唯一角色、服饰锚点、屏幕区域和动作。对高优先级角色使用参考图,保持摄像机运动简洁,并完整回看成段视频以排查人物互换或重复现象。

为何 AI 生成的人群视频常出现身体融合与多余人物?

人群场景包含大量重叠主体、快速运动、小尺寸人脸及深度不确定性。当提示词未明确定义图层或运动路径时,模型可能将一次遮挡误判为新身体或新身份。

Ready to try it yourself?

Free credits on signup. Plans from $20/month.

Try Seedance free

人群场景是否应单次生成?

仅对简单、轻微运动的背景适用单次生成。对于更密集的动作场景,应先生成或审核主角图层,再将人群作为第二图层进行控制,最后合成,或仅重跑最小失败区域。

为何人群场景比单人镜头更容易出错

单人图像转视频任务仅要求模型维持一个身份、一具身体与一个主要动作;而人群镜头则使这些约束成倍增加,并引入大量交叠——有人从主角身后穿过,有人走出画面,两人手臂重叠,数张小脸在压缩过程中移动。模型必须在每一帧中判定每个像素归属何人。正因如此,一张令人信服的静态海报仍可能生成无法使用的视频片段。

实际目标并非“生成大量人物”,而是维持可读的层级结构。请明确:观众必须识别谁?谁执行叙事动作?谁仅提供氛围?为主角提供最强参考与最大屏幕面积;将特写配角视为有姓名的角色;将其余人群视为共享方向、速度与深度的群体,而非二十个各自详述的陌生人。

一场电影排练将主角、导演与背景演员分离为清晰的纵深图层

将前景主角、中景调度与背景行走者视作彼此独立的控制问题,而非一个无差别的整体人群。

从一份简短的验收契约开始:主角面部始终可辨;无身体重复;前景路径不发生碰撞;特写服饰颜色分配恒定;进出画面各仅发生一次;背景不抢夺注意力。此举可将模糊的“人群看起来奇怪”转化为可隔离、可重跑的具体失败项。

在打开节点图前设计角色与区域规划

分配身份优先级

采用三级制:A 级为主角或发言者,需提供最清晰图像或参考视频;B 级含一至三位特写配角,其服饰与动作至关重要;C 级为氛围层:剪影、就座观众、通勤者或远处行人。切勿对所有人施加同等强度的条件控制。过多相互竞争的参考反而会降低画面清晰度。

在撰写提示词前,先编写一份精简清单:

角色 屏幕区域 视觉锚点 运动 必须保持成立
主角 前左至中央 锈红色外套、黑色包 向镜头行走 面部与外套保持稳定
配角 A 后左 深蓝色帽子 从左向右横穿 仅一次从主角身后经过
群体 B 远端站台 深色办公装束 缓慢上车 始终保持背景尺度

该表格是制作管控工具,而非必须逐字粘贴的文本。它迫使你在模型被迫猜测前即解决矛盾。若需在后续镜头中复用同一角色阵容,可参阅 多关键帧工作流,了解如何审核并复用视觉锚点。

划定深度与通行路径

将镜头草绘为前景、中景与背景三区。定义两至三条具有不同方向的运动路径。首次测试时,避免让多个完整人体同时穿过同一中心点。横向穿越比无约束地向四面八方涌动的人群更易判断。固定或缓速跟拍的摄像机可为身体运动与身份维持预留更多计算余量。

身着锈红色外套的通勤者保持视觉优先级,而背景行人于不同深度处穿行

使用遮挡测试:部分人物从前通过,另一些从后通过,再检查每具身体是否干净退出,而非发生融合。

构建 ComfyUI 人群视频工作流

1. 审批构图静态图

创建或提供一张干净的 16:9 或 9:16 图像,其中包含最终摄像机高度、人群密度、服饰分配及开放的运动路径。动画前须修正重复面孔、不可能的手部姿态或相交的脚部。图像转视频可对已审批帧进行动画化;它不应被期望修复本已混乱的人群布局。如需直接托管测试,Seedance 图像转视频通道 允许您无需维护本地节点图,即可评估同一源图。

2. 仅提取该镜头所需的控制项

根据预期失败类型选择引导方式:深度有助于维持前后顺序;姿态有助于特写动作;边缘可保护建筑结构或大型道具;分割图或蒙版有助于将主角与氛围人群隔离。选用能维持场景可读性的最轻量组合。在高强度下堆叠全部预处理器,可能导致运动僵硬,或引发各类控制间的冲突。对于移动参考,需裁剪出一段画面干净的片段,确保其相机运动与人物动作节奏相似。在提取前,先统一分辨率和帧率。确认姿态追踪(pose tracks)在行人交叉时不会在相邻人物之间跳变。一旦骨骼被错误交换,运动也会随之错乱——无论正向提示词(positive prompt)写得多么严谨。

3. 将主角运动与人群运动分离

以主角及少量群演为基准构建初始版本。固定随机种子(seed)、模型、采样器(sampler)、图像尺寸、帧数及相机指令。待主角运动通过验证后,再添加氛围性人群,或启用第二条条件控制分支。若工作流支持蒙版(masking)或合成(compositing),请尽可能长时间地保持主角与背景输出相互独立,以便单独修复其中一方,而无需重新生成全部内容。

src=https://r2.seedance.tv/blog/image-to-video-ai-with-prompt-online-free/social-motion-output-v1.mp4
poster=https://r2.seedance.tv/blog/image-to-video-ai-with-prompt-online-free/social-motion-output-poster-v1.jpg
label=站台中行人穿行的动态主体

该现有 Seedance 图书馆片段仅作检查示例,并非受控的 ComfyUI 基准测试。请全程观察主角身体、穿行行人、大衣边缘、脚部动作以及各类遮挡关系。

4. 保存工作流图与溯源信息

将工作流 JSON、模型文件名、自定义节点版本、输入哈希值、随机种子、图像尺寸、帧数、FPS、控制强度,以及最终采纳的输出一并保存。ComfyUI 支持仅重运行图中已更改的区域,但若未记录已批准的配置,这一优势将不复存在。若渲染完成后队列执行卡死,请先参考 ComfyUI 冻结恢复指南,再调整创意控制参数。

在提示词中描述多人而不引发混乱

按镜头顺序撰写提示词:场景设定 → 核心主体(priority subject)→ 特写群演(featured extras)→ 人群分组 → 相机 → 排除项。重要人物仅命名一次,并保持其描述语稳定。对背景人物宜采用集体式描述:“六名身着深色大衣的通勤者正朝敞开的车厢方向移动”,远比罗列大量互不相关的面孔、年龄与配饰更清晰明确。

一个实用模板如下:

宽景雨天站台,平视视角相机。身着铁锈色大衣的女子从左前方走向画面中央,目视前方。一名戴海军蓝帽子的男子从她身后由左向右穿行。远处一组乘客正缓慢登上静止列车。相机缓步前推;步行节奏自然;前景面部稳定;无人物重复;无碰撞;无突兀入画。

负面提示(negative instructions)应针对已观察到的可见失败类型,而非穷举所有可想象对象。“无重复身体、肢体融合、面部交换、行人瞬移、倒退行走,或新人物突入前景”是可操作的。若仅当主体缩小时面部才失效,则可参考 远距离面部修复指南 进行专项诊断,而非强行增强全局引导强度。

六名舞者各占独立通道,普通行人则保留在远处背景中

编舞测试应确保各身体与手势彼此独立,同时背景人流始终处于从属地位。

使用小型压力阶梯测试人群一致性

切勿直接从最终的节日、战场或演唱会场景起步。采用四阶递进法:
第一阶:仅动画化三人,且无任何穿行;
第二阶:允许一名群演从主角身后穿过;
第三阶:引入一次前景遮挡;
第四阶:添加一组远景氛围性人群。
全程保持短时长,并在每一阶段完成审查后再提升密度。

以正常速度及逐帧方式评估输出:

  • 身份一致性(Identity):核心人物的面部、发型与服饰始终归属正确;
  • 人数准确性(Count):前景中不出现新增人物,也不发生指定人物过早消失;
  • 解剖合理性(Anatomy):肢体在重叠前后均能正确分离;
  • 动线合规性(Traffic):每次入场、穿行与离场均严格遵循指定路径;
  • 纵深表现(Depth):远景人物始终保持较小尺寸,不突兀跃入前景;
  • 相机稳定性(Camera):相机运动不导致整组人物滑动或“呼吸式”晃动;
  • 时间收尾质量(Temporal finish):末帧足够稳定,可直接剪辑或延展。

记录任一规则首次失效的帧号。该节点常能揭示问题根源:是初始构图不良、姿态追踪错位、运动幅度过大、身份条件引导不足,抑或相机运动与人群行为产生冲突。

不重建全场景即可修复失败

若身体融合,可增大起始间距、简化穿行路径、强化深度或蒙版分离、缩短镜头时长;
若主角身份漂移,应减少提示词中人群细节,转而增强核心参考的影响力,而非盲目提升所有控制强度;
若背景冻结不动,可添加一项集体动作与轻微运动,切勿为每位远景人物单独设计表演。

当运动出现抖动,需逐帧检查姿态或光流引导信号;可平滑单条异常轨迹、在结尾处降低控制强度,或移除冲突的条件器;
当人物从画面边缘突兀弹入,应起始时减少邻近边缘的人物数量,并显式指定其入场方式。
每次实验旁均须保留一份成功基线图(baseline graph),确保节点更新绝不会覆盖上一个已知可用的配置。

繁忙的食品市场呈现丰富纵深层次,却未将每位顾客都设为特写角色

营造高密度氛围时,应优先评估纵深秩序、轮廓清晰度与交通可信度,再考虑为背景人物赋予个体化表演。

如需生成大量变体,请将创意生成与文件编排分离。ComfyUI 批处理指南 涵盖确定性文件夹结构、清单(manifest)与重试机制;本人群工作流应首先产出一个经认可的单镜头,再进入批量处理阶段。

当 Seedance Agent 是更简捷的制作路径本地 ComfyUI 图形在你需要精确的预处理器、自定义遮罩、模型级控制或可复现实验时非常有价值。但这也意味着你需自行负责参考素材管理、节点版本控制、队列状态、输出审核以及部分重运行。群体场景会进一步放大这种协调难度,因为单个额外角色被拒,就可能使原本表现强劲的一条镜头整体失效。

Seedance Agent 在生产任务的重要性高于图形所有权时尤为有用。你只需提供演员优先级、参考资源、镜头清单、人群通道、时长、宽高比及验收规则。在生成前审阅拟定的镜头方案,批准效果最佳的结果,并仅重运行失败的单元。其优势并非承诺每个群体角色都完美无瑕,而在于更清晰地划分规划、生成、审核与交付各阶段的职责边界。

结论

一套可靠的 ComfyUI 群体视频工作流,始于已获批准的构图,继而分配身份优先级,分离景深层次与通行通道,仅施加必要的控制,并通过可控的“压力梯度”逐步提升密度。对完整片段从身份一致性、人数准确性、解剖结构合理性、遮挡关系、运动自然度及结尾可用性等维度进行综合评判,随后仅修复最小的失败层级,而非全部重启。当维护参考素材、遮罩、节点版本、审核记录与重运行本身已成为主要工作负担时,请使用 Seedance Agent 规划并生成群体序列,同时将 ComfyUI 保留用于真正需要本地精细控制的镜头。

Ready to try it yourself?

Put the steps from this guide into practice with Seedance and turn prompts or images into polished videos in minutes.

Free credits on signup. Plans from $20/month.