每日签到 地址发布 老王说明书 宣传中心 繁/简
讨论怎么用ai搞涩涩
查看: 3.2W|回复: 82
收起左侧

[硬核教程] MiniMax H3测试+资源整理教程!平替seedance2.0最佳选择!

    [复制链接]
发表于 2026-8-13 01:10:44 | 显示全部楼层 |阅读模式

马上注册,结交更多好友,享用更多功能,让你轻松玩转社区。

您需要 登录 才可以下载或查看,没有帐号?免费注册

x
本帖最后由 123325 于 2026-8-13 03:25 编辑

各位道友们好!这次 MiniMax 开源的 H3,确实有点意外。
它是我玩过开源模型中最可控的 AI 视频模型之一。
简单来说我直接把wan2.2    LTX2.3 这些老模型全部删除了,硬盘瞬间充裕起来。
minimax-h3直出

8月12日 (1).gif

如果你之前没玩过本地AI视频,那么现在是开始玩comfyui 本地部署的最佳时刻!
为什么这么说?因为现在随着AI的各方面进步,已经降低了极大的门槛。
以前部署整合包难,工作流老出错,现在社区越来越完善,出错的概率极大改善。
以前的视频模型生成的视频非常差,连人物一致性都很难保持,现在海螺的H3模型保持一致性基本稳定了!
以前写提示词想半天,现在只需要把模板给大模型,提出你的要求,直接给你写稳定出片的提示词
以前打开工作流看不明白,摸不着头脑,无法使用,现在直接给你的codex   hermes 等智能体说:帮我启动comfyui 用MiniMax H3 这个模型    搭建工作流或者使用已经有的工作流,生成一个美女跳舞的视频 。然后等着他直接交付成片给你就行!  你不需要懂这些费脑子的事,就可以实现这些了。建议尝试使用一下你们就懂了,有想法,就能创造出好玩的东西!

这里附件提供全套 整合包 模型 工作流  
整合包来源: 最新版的秋叶整合包——+  自行优化 ‘ 把环境这些,常用好用的节点装好,整体更适合玩  MinMax H3相关工作流  适配了基础加速优化’。 相比以前的老整合包,环境更新一些。老整合包依旧可以使用,内核更新到最新即可!
整合包为纯净版 ,模型单独分开的,方便各种情况使用。解压即用便捷版!根据你使用情况会有些前置安装,比如你的显卡驱动这些,网盘里面有教程视频可以看看,来自B站鱼佬,论坛不能指路所以各位道友自行去支持一波!!!
为啥用秋叶整合包?因为 最适合新手,上手最简单 ,也最稳定!

下面是实测一些演示:
这是单图生视频直出竖屏   0.6 = 608 x1056
屏幕截图 2026-08-12 223341.png 8月12日 (1)(1).gif


全能多参考模式直出:0.5 = 544x960   女主  男主  场景  参考视频动作     

屏幕截图 2026-08-12 225146.png 8月12日 (1)(2).gif


换了场景和 参考视频 这里场景没稳住:

8月12日 (1)(3).gif
再来个高难度动作:

屏幕截图 2026-08-12 230227.png 8月12日 (1)(4).gif
再来个人物跳舞替换:

屏幕截图 2026-08-12 230754.png 8月12日 (1)(5).gif
再来个色色替换:参考视频预先用sam3遮罩处理一下更稳定出片!
屏幕截图 2026-08-12 231119.png 8月12日 (1)(6).gif


再来个动作迁移加替换场景:

屏幕截图 2026-08-12 231707.png 8月12日 (1)(7).gif



再来个故事板模式下和seedance2.0的对比:同样的素材和提示词,只有参考人物质感稍微不同

屏幕截图 2026-08-12 232124.png
左minimax-h3 右seedance2.0
8月12日 (1)(8).gif seedance2.0.gif
最后就是一个1分钟的成片,这里说明下如何让前后两段更加连贯
最常用的方法就是将第1段的尾帧截出来,放大一次,再加入下次生成时用作开场首帧参考,这就是为何全能参考模型的强大之处,对于短剧这些制作更加友好!!本地生成低成本抽卡更加友好:
屏幕截图 2026-08-12 233756.png
8月12日 (1)(9).gif 8月12日 (1)(10).gif 8月12日 (1)(12).gif
相关视频我会打包好,你们要提示词 直接拖入你的comfyui 界面就能看到,还包含工作流,当然是杂乱未整理的工作流,建议还是去网盘下载整理好的工作流。
注意!
随着社区的发展相信minimax-h3的生态会优化到更好,目前对NSFW的原生生成乳房部位还行,男女下体器官都很差,所以我都是靠r
ef2va 这款来参考编辑更有效果,fl2va图生视频直接出效果并不好。
整合包里面已经装好相关适配的基础加速
MINIMAX-H3质量稳定优先流  :为基础加速更稳定质量
MiniMax_H3 加速叠加工作流  :为各种加速BUF叠加速度更快了,同时画质,人物质感这些会下降一些,但是速度更快

建议12G显存以上玩,8G显存能玩但是速度慢很多
如果自己是那种不想折腾,又很小白的建议去微软商店下载个 Chatgpt   Codex   这种本地智能体,直接对话让他帮你搞定一切就行,跟着他学习会学得更快,比你买那些网课啥的更靠谱!!!

"道友们" 下面是对你有帮助的详细介绍,请留步了解一下可能对你有所帮助,当然如果你是大能强者直接无视即可!

33B 全模态视频模型开放权重!MiniMax H3 本地部署与 ComfyUI 使用教程
本文资料核对时间:2026 年 8 月 13 日。模型和 ComfyUI 更新较快,后续如文件名或节点发生变化,请以官方仓库为准。
如果你最近在关注 AI 视频,应该已经看到“海螺 3.0 开源”的消息了。
这次的 MiniMax H3 不只是普通的文生视频或图生视频模型。它把文字、图片、视频和音频放进同一套上下文中理解,不仅能生成画面,还能在一次推理中同时生成对白、环境音、动作音效和立体声音乐。
更重要的是,它已经提供开放权重,并由 ComfyUI 原生支持 T2V、I2V 和 R2V 工作流。也就是说,我们终于可以在本地尝试海螺这一代模型的核心视频生成能力了。
不过,“最高 2K”和“本地开放权重”并不能直接画等号。本文除了带大家完成 ComfyUI 部署,也会把 H3 当前到底开放了什么、不同模型该怎么选、提示词怎样写、低显存机器要注意什么,一次讲清楚。


一、MiniMax H3 到底是什么?MiniMax H3,也就是大家常说的海螺 3.0,是 MiniMax 在 2026 年 7 月底发布的通用全模态音视频生成系统。
它的主要能力包括:
  • 文生音视频(T2VA)
  • 首帧图生音视频(I2VA)
  • 尾帧图生音视频(L2VA)
  • 首尾帧生成音视频(FL2VA)
  • 图片、视频、音频混合参考生成(Ref2VA / R2V)
  • 原生同步生成对白、环境音、音效和背景音乐
  • 24 FPS 输出,支持 4~15 秒时长
  • 支持横屏、竖屏、方形及多种常见比例
官方规格中,H3 支持最高 2K、最长 15 秒,并输出 32 kHz 立体声音频;中文、英文、日文等 11 种语言的对白属于稳定支持范围。
它和以前的视频模型最大的不同传统工作流常常是“先生成无声视频,再用其他模型补口型、对白、音效和音乐”。H3 则会联合预测视频与音频 latent,让画面和声音在同一条时间线上共同生成。
这对以下场景特别有价值:
  • 人物边说话边做动作
  • 动作与撞击声、脚步声同步
  • 参考一段视频的运镜或动作
  • 参考一个人的音色生成新对白
  • 保留角色、服装、品牌文字和产品外观
  • 直接制作带完整声音氛围的短片


二、先说清楚:H3 当前“开源”了哪些部分?严格来说,MiniMax H3 目前属于开放权重模型,采用自定义的 MiniMax H3 Community License,并不是 Apache 2.0、MIT 这类标准开源许可证。
完整 H3 系统由三部分组成:
  • H3-Context-IR:理解并整理文字、图片、视频和音频之间的关系,把用户需求转换成模型更容易执行的结构化描述。
  • H3-Base:生成带立体声音频的 768p 视频。
  • H3-Regenerate-2K:把 768p 结果和原始上下文再次送入 H3,重新生成 2K 版本,而不是进行普通超分辨率放大。
目前可以本地部署的是 H3-Base。H3-Context-IR 和 H3-Regenerate-2K 因系统较复杂,官方暂未开放;完整 2K 流程仍需要调用 MiniMax API。
所以现阶段可以这样理解:
使用路线能力是否完全本地
ComfyUI + H3-BaseT2V、I2V、首尾帧、R2V、原生音频,主要为 768p
本地 H3-Base + 官方 APIContext-IR 编排、本地生成、2K 再生成否,部分步骤调用 API
海螺网页 / MiniMax API官方完整 H3 流程与 2K 输出


三、两个基础模型怎么选?H3-Base 不是一个模型包打天下,而是分成两套任务权重:
模型支持任务什么时候用
FL2VA文生视频、首帧、尾帧、首尾帧从文字或关键帧生成新视频
Ref2VA图片、视频、音频混合参考锁角色、服装、画风、动作、运镜或音色
简单判断:
  • 只有提示词,或者只有首帧、尾帧:选 FL2VA
  • 要参考人物图、动作视频、运镜视频或音色:选 Ref2VA
  • T2V 和 I2V 共用 FL2VA 权重,不需要重复下载两套。
  • R2V 必须换成 Ref2VA 权重,不能拿 FL2VA 硬跑。


四、ComfyUI 本地部署前的准备1. 软件要求
  • ComfyUI 0.30.0 或更高版本
  • 较新的 PyTorch 与显卡驱动环境
  • 足够的磁盘空间、系统内存和虚拟内存
  • 推荐使用 SSD 存放模型与缓存
ComfyUI 已经原生集成 H3 节点,不必为了基础工作流安装一堆第三方节点。更新 ComfyUI 后,在:
工作流模板 → Video → MiniMax H3
即可找到官方 T2V、I2V 和 R2V 模板。官方步骤与模板入口见
2. 显存到底需要多少?官方 ComfyUI 教程目前没有公布一个统一的“最低显存”数字,因为实际占用会受到分辨率、帧数、参考素材数量、系统内存、offload 策略和显卡量化算子支持影响。
这里提醒大家:能加载不等于能舒适使用,也不等于能在 768p、15 秒条件下稳定运行。
社区已有 16GB 显卡通过 --lowvram、CPU offload 和较大系统内存跑通的案例,但 768p、约 5 秒视频可能需要二十分钟级别,且系统内存占用很高。这类数据只能作为参考,不能直接推导出“8GB 显存畅玩 H3”。
对普通玩家更实际的建议是:
  • 首次测试先用较低分辨率和约 5 秒时长跑通工作流。
  • 系统内存尽量准备 64GB 或以上;低显存越依赖 offload,对内存和 PCIe 传输压力越大。
  • 预留至少 70GB~100GB 磁盘空间,便于安装一套或两套任务权重并保留缓存。
  • 不要一上来就测试 768×1344、15 秒和多参考素材。


五、下载哪些模型文件?ComfyUI 官方重打包模型位于
T2V / I2V / 首尾帧需要下载
类型文件名
体积约
扩散模型minimax_h3_fl2va_pruned_int8_convrot.safetensors
21 GB
文本编码器qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors
15.7 GB
视频 VAEminimax_h3_video_vae_fp16.safetensors
5.21 GB
音频 VAEminimax_h3_audio_vae_fp32.safetensors
605 MB
这套文件合计约 42.5GB。
R2V 额外或替换下载将扩散模型换成:
minimax_h3_ref2va_pruned_int8_convrot.safetensors
文本编码器、视频 VAE 和音频 VAE可以共用。如果两种模式都需要,只需同时保存 FL2VA 和 Ref2VA 两个扩散模型。
模型放置目录ComfyUI/└── models/    ├── diffusion_models/    │   ├── minimax_h3_fl2va_pruned_int8_convrot.safetensors    │   └── minimax_h3_ref2va_pruned_int8_convrot.safetensors    ├── text_encoders/    │   └── qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors    └── vae/        ├── minimax_h3_video_vae_fp16.safetensors        └── minimax_h3_audio_vae_fp32.safetensors注意:Comfy-Org 建议在 PyTorch + CUDA 13.0 可用时优先选择 int8_convrot;如果当前环境无法使用,再考虑 fp8_scaled。不要只根据文件名盲目混搭精度版本,先使用官方模板推荐组合跑通。


六、用官方模板完成第一次生成路线 A:文生视频 T2V
  • 更新并重启 ComfyUI。
  • 打开 工作流模板 → Video → MiniMax H3 T2V。
  • 确认加载的是 fl2va 扩散模型。
  • 确认文本编码器、视频 VAE 和音频 VAE 均已正确识别。
  • 第一次测试建议选择横屏或竖屏的低分辨率预览设置。
  • 时长先设在约 5 秒,确认能够正常生成画面和声音。
  • 输入结构化提示词,点击运行。
路线 B:图生视频 I2V / 首尾帧
  • 打开 MiniMax H3 I2V 模板。
  • 将图片接入 MiniMaxH3ImageToVideo 节点的 first_frame。
  • 如果有尾帧,再接入 last_frame;两者都不是必填。
  • 提示词不要重复描述参考图已经非常明确的静态信息,应重点说明动作路径、镜头和声音。
  • 首尾帧模式尽量使用单镜头连续变化,减少无必要的切镜
路线 C:多模态参考 R2V
  • 打开 MiniMax H3 R2V 模板。
  • 加载 ref2va 扩散模型。
  • 按固定顺序连接人物图、风格图、动作视频、运镜视频或音频。
  • 在提示词中严格使用 <icture 1>、<Video 1>、<Audio 1> 等标签。
  • 明确分配每个素材的职责,不要只写“参考以上素材”。
例如:
<icture 1> is fully referenced for the female swordswoman's facial identity,hairstyle, costume structure, body proportions and weapon design.<Video 1> is referenced only for the combat motion and camera movement.Do not copy the person, clothing or background from <Video 1>.<Audio 1> is referenced only for the female character's voice timbre.H3 的 R2V 模式最多支持 9 张图片、3 段参考视频和 3 段独立音频,混合素材总数上限为 12。参考视频单段应为 2~15 秒,视频总时长不超过 15 秒;音频也采用相同的单段与总时长限制。


七、分辨率和时长怎样设置?官方 ComfyUI 模板使用 Resolution Selector 控制比例、目标像素量和尺寸倍数。
建议注意三点:
  • 尺寸倍数保持 32,以符合 H3 的分辨率网格。
  • H3-Base 的原生画布以短边 768 像素为主,常用上限约为 1344×768 或 768×1344。
  • 完整 2K 不是把 Resolution Selector 直接拉高就能等价实现,而是官方 H3-Regenerate-2K 的再生成流程。
新手可以从下面的策略开始:
阶段建议设置目的
工作流排错低分辨率、约 5 秒快速确认节点和模型正常
构图测试480p 级、约 5 秒反复调整提示词和动作
正式生成768p 级、5~10 秒兼顾质量、速度与稳定性
2K 成片官方 API / 混合 2K 工作流使用 Context-IR 与 Regenerate-2K


八、H3 提示词不要再写成“关键词堆砌”H3 更适合使用沿时间线展开的导演式描述。官方提示词结构分为三个核心字段:
integrated_multimodal_description: [Shot 1] ...overall_soundscape: ...non_diegetic_music: ...
  • integrated_multimodal_description:画面风格、人物、动作、镜头、对白和画内声音。
  • overall_soundscape:环境声、脚步、碰撞、呼吸、衣料摩擦等整体声音。
  • non_diegetic_music:只有观众能听见的画外配乐;不需要配乐时写 N/A。
一个适合 H3 的完整示例下面用“女剑修渡劫时遭遇兽潮”做一条 8 秒竖屏视频提示词:
integrated_multimodal_description: [Shot 1] Live-action cinematic oriental fantasy,vertical composition, a medium-wide low-angle shot frames an adult female sword cultivatorstanding on a shattered stone platform above a mountain city at night. Her face, hairstyle,costume structure, body proportions and sword remain visually consistent. Violet lightningbranches across the storm clouds while her long sleeves and hair whip violently in the wind.The camera slowly pushes in as she raises the sword with both hands and gathers a clean arc ofpale-blue spiritual energy around the blade. At 00:03.200, a deep roar rises from below the citywall and she turns sharply toward the sound. [Shot 2] At 00:04.000, the camera cuts to an over-the-shoulder view, revealing a dense beast tide surging through the valley toward the city. The nearestbeasts strike the ground with heavy steps while larger silhouettes emerge through the rain behindthem. [Shot 3] At 00:06.000, the camera cuts back to a close medium shot. The swordswoman plants onefoot forward, lowers her center of gravity, and points the glowing blade toward the approaching tide.She says with a calm but determined adult female voice (S1): <d>[Chinese] 想进城,先过我这一剑。</d>A bolt of lightning strikes behind her at the final moment, outlining her clean silhouette withoutchanging her identity or costume.overall_soundscape: Violent mountain wind, heavy rain, distant thunder, cloth and hair whipping inthe air, the growing rumble of thousands of running beasts, stone fragments trembling across theplatform, and a sharp electrical crack as lightning strikes behind the swordswoman.non_diegetic_music: Low war drums at a slow tempo, joined by sustained cello and a single bambooflute phrase; the percussion increases in volume during the beast-tide reveal and stops on the finallightning strike.提示词写作的五条实用规则
  • 先写整体风格与初始构图,再写动作。 不要开头就塞满镜头术语。
  • 动作要有起点、过程和结果。 “挥剑攻击”不如“后撤半步—双手握剑—横向挥出—剑气击中地面”清楚。
  • 需要切镜时写明确时间。 例如 [Shot 2] At 00:03.500, the camera cuts to...。
  • 镜头运动写成自然句子。 说明 Push In、Tracking、Arc Shot 等运动类型,并在需要时补充速度和幅度。
  • 画面、动作和声音沿同一时间线描述。 不要把对白、音效和音乐全部挤在最后一句。


九、常见问题与排查方法1. 工作流打开后出现红色未知节点先更新 ComfyUI 到 0.30.0 或更高版本,再重启。H3 已是原生支持,旧版 ComfyUI 无法识别相关节点。
2. 模型下好了,但节点列表里找不到优先检查文件目录:
  • 扩散模型放 models/diffusion_models/
  • 文本编码器放 models/text_encoders/
  • 两个 VAE 都放 models/vae/
然后刷新模型列表或彻底重启 ComfyUI。
3. T2V 能跑,R2V 报模型或形状错误检查是否仍在使用 fl2va。R2V 必须加载 ref2va 权重,两者不是同一个模型文件。
4. 一到 VAE 解码就爆显存先降低分辨率、帧数和时长,再减少参考素材数量。低显存模式会把大量模型权重转移到系统内存,必须同时保证内存和虚拟内存充足。
5. 第一次特别慢,后面稍快首次运行可能包含模型加载、文本编码、算子初始化和缓存建立。比较速度时,应区分冷启动与已缓存状态。
6. 人物一致性不稳定如果只是首帧驱动,模型需要同时完成身份保持和动作推演。更严格的一致性任务建议改用 R2V,并明确写出:哪张图锁定脸、服装和武器,哪段视频只参考动作或运镜。
7. 首尾帧过渡不自然首尾两张图的主体位置、视角、光线和场景差异不要过大;提示词应描述可观察的中间变化。官方建议首尾帧任务优先采用单镜头连续路径。
8. 音画都有,但对白不稳定给说话者固定编号,例如 (S1),并把实际台词放入:
<d>[Chinese] 这里填写台词。</d>同一人物跨镜头继续说话时,保持相同编号,不要重复创建新说话者。
9. 想加速生成ComfyUI 官方教程提供了 Sage Attention 路线,安装匹配当前 PyTorch 与 CUDA 的 sageattention 后,可通过 KJNodes 的 Patch Sage Attention KJ 节点或启动参数 --use-sage-attention 启用。官方称示例工作流中速度可大致提升一倍,但实际效果仍取决于显卡、算子和工作流。


十、许可证和商用必须注意MiniMax H3 使用自定义 Community License。发帖或部署前,建议所有读者亲自查看 MiniMax H3 完整许可证。以下只做信息提示,不构成法律意见:
  • 当前许可证的适用地域排除了欧盟、英国、韩国和美国;这些地区需要联系 MiniMax 获取相应授权。
  • 在适用地域内,许可证允许使用、修改和创建衍生模型,但需遵守地域限制及 Acceptable Use Policy。
  • 年营收超过 2,000 万美元的商业产品或服务,需要事先取得 MiniMax 的书面授权。
  • 使用 H3 的商业产品或服务界面需要显著展示 “MiniMax H3”。
  • 不得用 H3 或其输出改进其他 AI 模型,但 H3 自身及其衍生模型除外。
  • 模型输出不被 MiniMax 主张权利,但使用者需自行对生成内容及其后续使用负责。
所以,“开放权重”不代表“无条件、全球、随意商用”。特别是准备做在线生成服务、企业项目或模型训练的朋友,一定先确认自己的所在地、业务规模和使用方式是否符合许可。


十一、我的使用建议如果只是想体验 H3 的生成质量,先去海螺网页端或官方 API 测试最省事;如果要研究工作流、控制每个参数、批量生产,ComfyUI 才是更有价值的路线。
本地玩家建议按这个顺序入门:
  • 先下载 FL2VA,跑通 5 秒低分辨率 T2V。
  • 再做单首帧 I2V,学习动作路径描述。
  • 然后尝试首尾帧,控制明确的开始与结束状态。
  • 最后再下载 Ref2VA,挑战角色、动作、镜头与音色的多参考组合。
  • 提示词稳定后再提升到 768p 和更长时长,不要在排错阶段浪费大量生成时间。
H3 最值得关注的不是单纯“又一个大参数视频模型”,而是它把画面、动作、镜头、对白、音效和音乐真正放进了同一个生成系统里。当前开放版本还不是完整的 2K 全流程,硬件门槛也不低,但对于 ComfyUI 用户、工作流作者和 AI 影视创作者来说,它已经提供了非常大的探索空间。
后续如果官方开放稀疏注意力和 H3-Regenerate-2K,本地生成速度与完整度还会继续变化。建议收藏官方仓库,并在更新 ComfyUI 后重新查看模板与模型说明。



如果这篇教程对你有帮助,欢迎收藏、回复并分享你的显卡配置、生成耗时和工作流设置。不同显卡与内存组合的数据越多,越能帮助后来者少走弯路。

minimax-H3资源整理分享.txt

364 Bytes, 下载次数: 1618

售价: 3 软妹币    [购买]

演示视频带提示词数据都包含在内

回复

使用道具 举报

 楼主| 发表于 2026-8-14 17:45:28 手机版 | 显示全部楼层
kkkxyz 发表于 2026-8-14 17:12
大佬牛逼!!
LTX2.5 也上线了,感觉是和H3打擂台的,用的A卡,各有优势

试了,ltx2.5 速度快   ,清晰度高点       质量表现和一致性这些还是差得远
回复 支持 5 反对 0

使用道具 举报

 楼主| 发表于 2026-8-14 00:04:52 手机版 | 显示全部楼层
我的明星 发表于 2026-8-13 23:15
这个有点不懂(最后就是一个1分钟的成片,这里说明下如何让前后两段更加连贯
最常用的方法就是将第1段的尾 ...

截取方法我之前的wan  animate 脱衣那期有讲怎么截取视频中的一帧出来    比如你第一个视频跑的是  1280*736   那么你截取出来的图片 就是这个尺寸  你第二个视频也是跑这个尺寸  所以直接就对上的    提示词写明了这张用做首帧, 模型就会照做  他这个模型很聪明了,不是以前那些能比的了  ,当然如果没照做也可以直接切到首帧模式生成             两段合起来  截出来这个画面就重复了 后面剪辑时把这一帧的位置剪掉就会看起来连贯丝滑了

具体截帧方法 有很多种   你们可以直接问大模型  或者看下我之前那期讲的  这些都是些简单小技巧,操作一点也不难
回复 支持 3 反对 0

使用道具 举报

发表于 2026-8-16 10:34:25 | 显示全部楼层
有没有大佬上传一下度盘,夸克没会员。
回复 支持 2 反对 0

使用道具 举报

发表于 2026-8-16 02:43:47 | 显示全部楼层
能补一下演示样品分卷2吗
回复 支持 0 反对 1

使用道具 举报

发表于 2026-8-14 02:28:58 手机版 | 显示全部楼层
看不懂啊
回复 支持 1 反对 0

使用道具 举报

发表于 2026-8-13 22:59:58 手机版 | 显示全部楼层
太难了 看不懂 这是个技术佬
回复 支持 1 反对 0

使用道具 举报

发表于 2026-8-13 23:12:21 | 显示全部楼层
终于等到大神出手了,感谢您的无私分享,祝您健康快乐。
回复 支持 反对

使用道具 举报

发表于 2026-8-13 23:15:44 | 显示全部楼层
这个有点不懂(最后就是一个1分钟的成片,这里说明下如何让前后两段更加连贯
最常用的方法就是将第1段的尾帧截出来,放大一次,再加入下次生成时用作开场首帧参考,这就是为何全能参考模型的强大之处,对于短剧这些制作更加友好!!本地生成低成本抽卡更加友好:)这个尾帧生成的视频2怎么保证和视频1的画面中人物在画面的位置完全适配呢,不会突然缩小或者扩大一下的情况
回复 支持 反对

使用道具 举报

发表于 2026-8-13 23:59:13 手机版 | 显示全部楼层
回复 支持 反对

使用道具 举报

发表于 2026-8-14 04:11:54 手机版 | 显示全部楼层
请问这个支不支持20系显卡和v100?v100不支持sage attention,但是有些节点的采样器默认开启会导致报错,不知道有没有不带sage attention的minimax的工作流?
回复 支持 反对

使用道具 举报

发表于 2026-8-14 05:05:30 | 显示全部楼层
不行。。。参考视频动作达不到上面的效果,用GROK的提示词也不行
回复 支持 反对

使用道具 举报

发表于 2026-8-14 08:36:18 | 显示全部楼层
8G显存32G运存确实跑的通,但是时间长,试着跑了一下就算了,还要留着显卡玩游戏,万一坏了更换成本太高了
回复 支持 反对

使用道具 举报

发表于 2026-8-14 09:17:51 | 显示全部楼层
膜拜技术佬
回复 支持 反对

使用道具 举报

 楼主| 发表于 2026-8-14 09:54:49 手机版 | 显示全部楼层
粉红小拿铁 发表于 2026-8-14 04:11
请问这个支不支持20系显卡和v100?v100不支持sage attention,但是有些节点的采样器默认开启会导致报错,不 ...

V100额外:关掉 FP8,精度FP16,选 sdpa。

RTX20:精度FP16,选 xformers。

把sage 的节点删除   修改好就行
回复 支持 反对

使用道具 举报

发表于 2026-8-14 10:49:24 手机版 | 显示全部楼层
视频资源是空文件夹
回复 支持 反对

使用道具 举报

发表于 2026-8-14 12:16:19 | 显示全部楼层
演示文件是空的哦大佬
回复 支持 反对

使用道具 举报

 楼主| 发表于 2026-8-14 12:31:20 手机版 | 显示全部楼层
gghh 发表于 2026-8-14 10:49
视频资源是空文件夹

被和谐了,就是快,有的喜欢网盘里打开
回复 支持 反对

使用道具 举报

 楼主| 发表于 2026-8-14 12:32:33 手机版 | 显示全部楼层
huyang584 发表于 2026-8-14 12:16
演示文件是空的哦大佬

被和谐了,等我补吧
回复 支持 反对

使用道具 举报

发表于 2026-8-14 15:19:35 手机版 | 显示全部楼层
提示词有个官方的skill,用破限的llama可以直接生产提示词,用官方模板效果更好
回复 支持 反对

使用道具 举报

发表于 2026-8-14 17:12:32 | 显示全部楼层
大佬牛逼!!
LTX2.5 也上线了,感觉是和H3打擂台的,用的A卡,各有优势
回复 支持 反对

使用道具 举报

 楼主| 发表于 2026-8-14 17:43:08 手机版 | 显示全部楼层
胖贝壮壮 发表于 2026-8-14 15:19
提示词有个官方的skill,用破限的llama可以直接生产提示词,用官方模板效果更好 ...

我网盘里面有放  
回复 支持 反对

使用道具 举报

您需要登录后才可以回帖 登录 | 免费注册
点击进行验证

本版积分规则

我们不生产资源,只做资源的搬运工。

广告合作-tags标签-app下载-Archiver-小黑屋-