ARTICLE · INTELLIGENCE

战地情报 · 详情页

来自尧图项目组的一线实战观察与深度解析

LTX-2模型微调指南:单卡LoRA、IC-LoRA与全参数微调的实操清单

LTX-2模型微调指南:单卡LoRA、IC-LoRA与全参数微调的实操清单 LTX-2模型微调指南单卡LoRA、IC-LoRA与全参数微调的实操清单【免费下载链接】LTX-2Official Python inference and LoRA trainer package for the LTX-2 audio–video generative model.项目地址: https://gitcode.com/GitHub_Trending/lt/LTX-2手里有一批自己的素材想让 LTX-2 这个音视频生成模型产出带你风格的结果官方仓库里的 ltx-trainer 包负责这件事它提供三个入口单卡 LoRA、配对数据 IC-LoRA、多卡全参数微调。这份指南按先判断、再动手的顺序写先花 30 秒对号入座再照着每个场景的最小步骤跑起来。 先花30秒判断该用哪种方式手里只有视频 文字说明单卡、想几小时内出效果选单卡 LoRA32GB 显存也够用换一份低显存配置就行数据成对出现风格参考对目标视频、深度图对原片要教会模型一种固定变换选 IC-LoRALoRA 已经学不到你要的效果想动模型的基础能力且手里有 4-8 张 H100 80GB 级别的卡才考虑全参数微调三种方式共用同一个训练脚本入口 train.py 和 flexible 训练策略差别只在配置文件和数据格式。13 种训练模式的条件写法可以看训练模式文档。单卡跑通 LoRA 的最小路径适用信号数据只是视频 说明文字没有成对参考单张 GPU希望在短周期内拿到可用的适配器第1步克隆仓库并安装依赖训练包在 monorepo 里依赖从根目录装然后切到 ltx-trainergit clone https://gitcode.com/GitHub_Trending/lt/LTX-2 cd LTX-2 uv sync cd packages/ltx-trainer第2步预处理视频数据把视频和对应说明文字整理好用 process_dataset.py 把视频和文字编码成潜变量与文本嵌入输出默认写到.precomputed/。目录怎么摆、长视频要不要先切片见数据集准备文档。第3步填好路径启动训练复制 t2v_lora.yaml改三处路径模型model_path、文本编码器text_encoder_path、数据根目录data.preprocessed_data_root。然后运行uv run python scripts/train.py configs/t2v_lora.yaml。产物在输出目录的checkpoints/lora_weights_step_xxxxx.safetensors拿到 ltx-pipelines 的推理管道里通过loras参数加载即可。最常见的坑标准配置面向 80GB 级别显存32GB 左右的卡直接爆显存时别先想砍步数换成 t2v_lora_low_vram.yaml。它开了 INT8 量化模型显存约省一半、8bit AdamW优化器状态约省 75%LoRA rank 也从 32 降到 16。 配对数据什么时候训 IC-LoRA适用信号数据成对每个目标视频都有对应参考Canny 边缘、深度图、风格参考目标是固定变换风格迁移、去模糊、上色、控制信号引导第1步生成参考视频参考需要计算的话跑 compute_reference.py 生成 Canny 等参考并写回数据集 json 的reference_video列。第2步目标与参考一起预处理再跑一次process_dataset.py目标潜变量和参考潜变量会分别写入.precomputed/下的不同目录参考列按约定自动识别不用额外传参数。第3步用 IC-LoRA 配置训练复制 v2v_ic_lora.yamlLoRA 目标模块已配成视频分支填好路径后按同样方式启动。推理时改用ICLoraPipeline加载你的适配器。最常见的坑参考和目标必须帧数一致且两边都完成预处理缺一个都会直接报错。全参数微调什么时候才值得上多卡适用信号LoRA 容量不够需要改动模型的基础能力有 4-8 张 H100 80GB 级别的卡可用第1步把训练模式改成 full在配置里把model.training_mode从lora改成full其余数据和策略部分保持不变。第2步用 FSDP 启动全参数训练要把参数切分到多卡仓库自带 accelerate 配置选fsdp.yaml自动包装 transformer 块默认 4 进程CUDA_VISIBLE_DEVICES0,1,2,3 \ uv run accelerate launch --config_file configs/accelerate/fsdp.yaml \ scripts/train.py configs/t2v_lora.yaml最常见的坑fsdp.yaml里num_processes默认是 4和你的实际卡数对不上时用--num_processes N覆盖或改配置文件。另外产物是全模型权重model_weights_step_xxxxx.safetensors比 LoRA 适配器大得多先留好磁盘空间。 一张表做最终决策拿不准的话按实际会影响你的三个维度对比硬件花多少、周期多长、能改到什么程度。维度单卡 LoRAIC-LoRA全参数微调硬件成本1 张 32GB 或 80GB 卡单卡到多卡4-8 张 H100 80GB 级训练周期最短中等最长能改到什么程度风格、概念层面一种固定变换模型基础能力输出产物适配器 .safetensors适配器全模型权重数据要求视频 说明文字成对参考 目标更大、更杂的数据集实际操作里大多数人停在一列就够了风格类需求 LoRA 基本能覆盖只有当 LoRA 持续学不动、且手里确实有多卡资源才往右走。按顺序做三件事用 t2v_lora.yaml 先跑通一次 LoRA确认整条链路没断有配对数据的话把 IC-LoRA 分支跑一遍前两项都符合预期后再为全参数微调规划多卡预算【免费下载链接】LTX-2Official Python inference and LoRA trainer package for the LTX-2 audio–video generative model.项目地址: https://gitcode.com/GitHub_Trending/lt/LTX-2创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
RELATED READING

延伸阅读

更多一线实战笔记与深度复盘,助您持续精进