Instructions to use MiniMaxAI/MiniMax-H3 with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Diffusers
How to use MiniMaxAI/MiniMax-H3 with Diffusers:
pip install -U diffusers transformers accelerate
import torch from diffusers import DiffusionPipeline # switch to "mps" for apple devices pipe = DiffusionPipeline.from_pretrained("MiniMaxAI/MiniMax-H3", dtype=torch.bfloat16, device_map="cuda") prompt = "Astronaut in a jungle, cold color palette, muted colors, detailed, 8k" image = pipe(prompt).images[0] - Inference
- Notebooks
- Google Colab
- Kaggle
请教一下,这个模型如何生成一个可以首尾循环的视频?
如题。当我尝试用同一张图片同时作为视频的首帧与尾帧时,发现生成的视频几乎完全不动了,或者模型干脆完全忽略掉了尾帧了。
这个问题还没研究过,有没有社区大神有结论的
提示词是怎么写的,我在提示词中描述了人物的动作和语言,没出现这样的情况,首尾帧相同
提示词是怎么写的,我在提示词中描述了人物的动作和语言,没出现这样的情况,首尾帧相同
提示词参考官方给出的模板写的。这些动作提示词在首帧模式、尾帧模式或者首尾帧是两张差距较大的图片时,都是可以正常工作的。可是,一旦首尾帧是两张一模一样的图片时,很多动作动态直接就失效了,几乎成了静止画面,最多只会有一些小幅度的动作。你可以试试图片中有水面的情况,其它模式下,水面都是会正常波动的,而在首尾帧是两张一模一样的图片时,水面直接就静止了。
我用了lightx2v刚出的加速lora后,对于首尾帧是两张一模一样的图片的情况,动作动态基本正常了,简直逆天啊。
提示词是怎么写的,我在提示词中描述了人物的动作和语言,没出现这样的情况,首尾帧相同
提示词参考官方给出的模板写的。这些动作提示词在首帧模式、尾帧模式或者首尾帧是两张差距较大的图片时,都是可以正常工作的。可是,一旦首尾帧是两张一模一样的图片时,很多动作动态直接就失效了,几乎成了静止画面,最多只会有一些小幅度的动作。你可以试试图片中有水面的情况,其它模式下,水面都是会正常波动的,而在首尾帧是两张一模一样的图片时,水面直接就静止了。
我也是没有遇到过,也是首尾帧都是同一张图,树叶落下、头发飘动、手镯反光、水波纹、切镜都是可以的,提示词用GPT写和用本地模型写都能表达,而且用的模板是I2V,实际生成是FLF2V或者FLF2V提示词生成FLF2V都有,5秒15秒都没有说几乎静止,而且都没用lightx2v
我觉得这里的关键不只是“首帧和尾帧使用同一张图”,而是要把 中间运动路径写得足够明确。
官方 FL2VA Prompt Guide 的推荐结构其实是:
first-frame state → observable intermediate changes → progressively narrowing differences → last-frame state
所以如果首尾帧完全一样,而 Prompt 又没有明确描述中间发生了什么,模型很容易找到一个最简单的解:整段尽量保持静止。
可以尝试把 Prompt 写成“闭环动作”,例如:
How the reference pictures align with the target video —
Picture 1 aligns with 0.00 seconds;
Picture 2 aligns with the end of the target video.
integrated_multimodal_description:
[Shot 1] The subject begins in the exact pose and composition established by Picture 1.
During the middle of the shot, the subject performs one clearly observable action while the camera follows a continuous motion path.
The action reaches its maximum displacement around the middle of the video, then gradually reverses.
During the final seconds, the subject, camera, lighting, and composition progressively return toward the starting state and settle into the exact framing established by Picture 2.
比如人物循环,可以设计:
站立
→ 转身 / 抬手 / 行走一小段
→ 动作达到最大幅度
→ 反向回到初始姿势
而不是只写:
first frame = image
last frame = same image
另外我会优先保持 single shot,因为官方 Guide 对 FL2VA 本身就更推荐连续的单镜头插值路径。
如果目标只是做无缝 loop,我会先测试:
- 首尾使用相同构图;
- 中间明确一个可观察动作;
- 写出动作如何“返回”;
- camera 也要回到最初位置;
- 避免中间多次 cut。
这样模型获得的是:
“完成一个闭环运动”
而不是:
“把同一张图片保持到最后”。
感谢上面的详细回复。首尾循环视频的问题我很久之前就解决了,或许也会有人遇到我当初的问题,所以我也大致总结一下心得。
就像上面说的,提示词要尽量按照时间顺序写得详细一些,推荐至少划分两个以上的时间段,即前面几个时间段做出各种想要的动作,最后一个时间段让动作回归到一开始的状态。若是遇到水面不波动等问题,那么通常是动态不够,如果提示词无效,还可以使用各种lora来增强动态。
至于模型的选择上,我现在基本使用ref2va模型了,配合comfyui官方的“Add Guide for MiniMax H3”节点,可以锁定任意关键帧,轻松实现首尾帧功能,而且更灵活,拥有多参功能,个人使用体验上各方面效果更好,而且可以添加各种参考来增强一致性。