重塑世界,留住真人——第三条视频路线
真人出镜这条路有两个已知的天花板:机器不能凭空捏造一个主播,而"字幕配原始素材"是那种诚实但没什么力度的退路。一条小红书教程补上了第三条路,owner 从中提炼出了它的一般形式:从原始素材里留下真人本人(抠像、声音、手势),把周围的一切按参考风格重新生成。 主播——那个假不了、算法又偏爱的成分——保持真实;环境则变成一段被设计出来的动态画面。真人出镜的自由:拍一次,随意换风格。
教程的流程是这样的:Pinterest 风格参考图 → 交给 Claude,配一段反复打磨过的 prompt(分析这些参考图,写一份详细的视频生成 Prompt,把我的原始视频转换成风格完全一致的动态图形,里面有 VO SCRIPT,加上 Movement/Aesthetic/Feel/Color 四个 STYLE 槽位,以及严格的输出格式:Summary / Sync Rules / Scene-by-scene / Output Spec)→ Google Flow,用一个以视频为条件的模型(Omni Flash)→ 拼贴式动画,真实的脸和声音保留下来,镜头自动切换。
owner 的三段式推广(比教程本身更犀利):模型可换(任何以视频为条件的生成器,或者一个纯机械的退路——抠像加 Remotion 搭出来的世界)、风格可换(拼贴只是一种参考集;品牌皮肤可以选另一种)、prompt 的模式才是真正的资产——一种两阶段结构,先由一个强 LLM 读真实的参考图,把它们转译成精确的生成语言,而不是由人手写风格描述。留意一下教程自己的"不要写实人类"输出规范:它从生成端印证了我们"不能捏造主播"这条法则——剪辑里唯一的真人,就是那个真实的人。
编入机器,作为 skills/style-transfer-video(路线 C)。相关:apply-your-own-theory(格式真相:跑一个人,不是跑一个 logo)、um-as-skills(来源分级——一位实践者反复打磨过的 prompt 是值得整段收割的二级教材)。