数字人开源模型推荐+魔改方案

9 月 2 日
 Liu6

ps: 节点有问题,劳烦移动一下。我没找到数字人节点

视频生视频模型
1 、音频到视频 1 分钟视频生成时间 3-10 分钟左右
2 、能跑着,走着说,角度最好能 90 度
3 、可以批量生成
4 、交付源代码.能最后封装到给 api 接口
5 、能支持高清,720P 以上
6 、除了改嘴型,背景文字和画面不改变
7 、嘴巴颜色正常,不过红,牙齿清晰

图生视频
1 、图片生成视频时间 1 分钟视频生成时间 30 分钟以内
2 、能跑着,走着说
3 、可以批量生成
5 、能支持高清,720P 以上
6 、手部动作可以调节
7 、嘴巴颜色正常,不过红,牙齿清晰

目标: 对口型
其实最主要的就是质量问题
目前我也尝试了开源的模型,还是会出现口型会出现模糊,牙齿不清晰, 画面撕裂等 场景可以参考(原视频嘴巴不动, 跑, 跳等)

求各位大佬分享开源模型+魔改方案
实在不行购买也行,需要所有的源代码,我这边会封装成 API 。
不需要考虑硬件问题
球球啦~

1992 次点击
所在节点    程序员
13 条回复
blueslmj
9 月 2 日
我还以为是你推荐。。
coefu
9 月 2 日
不标价格不够诚意。
Liu6
9 月 2 日
@blueslmj #1 我敲, 我也想推荐。
Liu6
9 月 2 日
@coefu #2 价格你们报价啊。
manhere
9 月 2 日
开源的基本都是玩具
hsuehly
9 月 2 日
有这方案,我自己都成立公司了
defunct9
9 月 2 日
我有,刚弄了一套
isSamle
9 月 2 日
你提供硬件,我 SSH 隧道进去研究玩玩
panxi
9 月 3 日
我自己魔改的 1080P 分辨率 1:0.5 的速度, 前提是第一次得创建缓存,后面推理命中缓存就飞起
panxi
9 月 3 日
不过就是是单步 U-Net 生成, 最近正在替换成 多步潜空间扩散生成, 提升唇部质量
Liu6
9 月 3 日
@panxi #10 大佬, 求分享
panxi
9 月 3 日
@Liu6 #11 分享不了一点啊大兄弟,这是真调优版本,玩具才会开源😂😂😂
Liu6
9 月 3 日
@panxi #12 那能否提供一些稍微细一点的思路? 我自己琢磨琢磨。

这是一个专为移动设备优化的页面(即为了让你能够在 Google 搜索结果里秒开这个页面),如果你希望参与 V2EX 社区的讨论,你可以继续到 V2EX 上打开本讨论主题的完整版本。

https://v2ex.ih06.com/t/1238878

V2EX 是创意工作者们的社区,是一个分享自己正在做的有趣事物、交流想法,可以遇见新朋友甚至新机会的地方。

V2EX is a community of developers, designers and creative people.

© 2021 V2EX