ARTICLE · INTELLIGENCE

战地情报 · 详情页

来自尧图项目组的一线实战观察与深度解析

HeyGem.ai 本地部署:从 10 秒素材到数字人口播视频

HeyGem.ai 本地部署:从 10 秒素材到数字人口播视频 HeyGem.ai 本地部署从 10 秒素材到数字人口播视频【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-AvatarHeyGem.ai 是一款能完全离线跑的 AI 视频生成平台上传一段 10 秒左右人说话的视频它克隆形象和声音再用文字或音频驱动数字人合出口型、生成数字人视频。本地部署后全程不需要联网素材和成片都留在你自己的机器上。下面把它能做什么、怎么跑起来、怎么把效果做顺一次讲清楚。 它到底解决了什么问题商用链路贵素材还要出门商用的数字人服务按条计费素材和成片都得过一遍云端。HeyGem.ai 把全部算力压到你自己的 NVIDIA 显卡上模型在本地、素材在本地、成片在本地隐私自己掌握。开源协议也支持全球免费商用商用场景用不卡壳。装好之后能干三件事克隆形象与声音上传一段约 10 秒的人说话视频程序自动分离音画完成声音克隆文字或音频驱动口型输入文案由 TTS 转成语音或直接上传自己的音频数字人跟着说话这条文字 → 语音 → 视频链路就是完整的多模态视频生成多语言脚本中、英、日、韩、法、德、阿、西 8 种语言都支持。界面很直白首页两个大入口创建视频和创建形象下面挂着作品库和数字模特列表。跑起来之前你需要什么装完依赖就能直接跑差得远。HeyGem.ai 是 Electron 桌面客户端 三个 Docker 服务语音识别、语音合成、视频合成的组合动手前先看硬件和磁盘。先对一遍机器项目要求说明显卡NVIDIA 显卡 驱动装好全部算力靠它nvidia-smi查不到显卡就起不了服务内存32G 及以上16G 可能撑不起三个服务磁盘镜像约 100G数据再留 30GWindows 下镜像默认在 C 盘系统Windows 10 19042.1526 或 Ubuntu 22.04Ubuntu 桌面版已做过适配验证C 盘紧张的话在 Docker Settings → Resources 里把 Disk image location 改到大容量的盘。70G 镜像下载完 C 盘爆满是最容易先踩到的坑。提前拉好三个镜像三个镜像分别是guiji2025/fun-asr语音识别、guiji2025/fish-speech-ziming语音合成、guiji2025/duix.avatar视频合成总下载量约 70GB看网速要等半小时以上。连 Docker Hub 慢的话先在 Docker Engine 设置里配国内镜像源再动手从零到出片的完整路径第一步克隆仓库、启动客户端先把代码拉下来以开发模式跑客户端需要 Node.js 18嫌折腾的话也可以直接用官方构建好的安装包git clone https://gitcode.com/GitHub_Trending/he/HeyGem.ai cd HeyGem.ai npm install npm run dev第二步拉起三个服务端服务端用的 docker-compose 文件在deploy/目录里到那个目录执行一条命令把三个服务全拉起来cd deploy docker-compose up -dDocker 里看到 asr / tts / gen-video 三个容器、状态都是 Running服务端就齐了。第三步创建数字人出第一条片点创建形象上传那段 10 秒的人说话视频。注意素材必须有清晰人声——程序要拿这段声音去克隆静音的片子会直接失败。上传后别急着点下一步ASR 服务是启动最慢的一个Docker 起来后等几分钟再操作。虚拟角色建好后输入文案或上传音频数字人视频生成流程就走完了几分钟后得到一条口型对齐的口播视频。让效果更好的几个关键点素材质量决定上限后面的参数都是在克隆质量基础上做加法。源素材越长越好吗不一定10 秒左右就够正面、脸部无遮挡、声音干净没有背景音乐素材越好口型上限越高。显存不够就换 lite 版完整版一次拉三个服务其中视频合成最吃显存。显存紧张、只需要口型合成这一步的话用 lite 的 compose 文件cd deploy docker-compose -f docker-compose-lite.yml up -d它只起Duix.Avatar-gen-video一个服务端口 8383。如果是 5090 这类 50 系显卡改用docker-compose -f docker-compose-5090.yml up -d官方已实测可用。开放 API 接进自己的程序服务端起来后核心能力以本地 API 暴露语音合成走 18180 端口视频合成走 8383http://127.0.0.1直接调。客户端自己的调用代码就是最好的参照src/main/service/ 里三个文件分别是模型训练、语音合成、视频合成的实际实现比看文档直接。翻车了怎么办服务起不来按概率排序三个容器没全部 Running打开 Docker 逐个看NVIDIA 驱动挂了nvidia-smi查不到显卡就起不了服务这是本项目最硬的约束——所有算力都在本地版本旧了项目更新频繁到deploy/重新执行docker-compose up -d把服务端刷一遍。建形象报 Connection refused基本是 ASR 服务还没启动完再等几分钟重试。如果机器内存只有 16G服务可能直接起不来32G 是硬门槛别抱侥幸。先查日志的这两个位置客户端右上角设置菜单里打开日志目录重点看里面的main.log服务端点开各个 Docker 服务进容器日志把报错段直接复制出来。更典型的报错和解法直接翻项目里的官方 FAQ doc/常见问题.md。下一步就三件事把仓库 clone 下来、拉好三个镜像、花一个下午让第一条数字人口播片跑出来。先用完整版把流程走通再按自己的显存切 lite 或用 API 接进你自己的工具链。【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
RELATED READING

延伸阅读

更多一线实战笔记与深度复盘,助您持续精进