关于AIGC人工智能、思维方式、知识拓展,能力提升等。投稿/合作: @inside1024_bot
AIGC 领域的最新工具、开源项目以及行业大事件
AIGC 领域的最新工具、开源项目以及行业大事件
🧙♀️我无数次表达过 GPT image 是真正的魔法。但难以置信的是,仅仅半年时间Gemini 2.5 flash image 就将这种魔法上升到了全新的层次:
- 10倍的生成速度
- 惊人的品质和一致性
- 几乎完全免费
值得再次强调是,获取这种魔法的唯一门槛就是亲自尝试——「对话」的能动性成为了唯一的门槛。
- 10倍的生成速度
- 惊人的品质和一致性
- 几乎完全免费
值得再次强调是,获取这种魔法的唯一门槛就是亲自尝试——「对话」的能动性成为了唯一的门槛。
所以你可以通过手绘图精准控制多个角色打斗姿态!
提示词:Have these two characters fight using the pose from Figure 3.Add appropriate visual backgrounds and scene interactions,Generated image ratio is 16:9
终于,声音驱动视频的开源模型来了!
Wan2.2-S2V,一个专为电影级音频驱动人体动画设计的 14B 参数模型。
超越普通的对口型,用声音驱动角色动作!
而且它还是开源的!
这个模型非常内容创作者制作沉浸式 AI 故事。
也是 ListenHub 和 FlowSpeech 的最佳搭档!
主要特点:
🔹长视频动态一致性
🔹影院品质的音频到视频生成
🔹通过指令进行高级运动和环境控制
Wan2.2-S2V,一个专为电影级音频驱动人体动画设计的 14B 参数模型。
超越普通的对口型,用声音驱动角色动作!
而且它还是开源的!
这个模型非常内容创作者制作沉浸式 AI 故事。
也是 ListenHub 和 FlowSpeech 的最佳搭档!
主要特点:
🔹长视频动态一致性
🔹影院品质的音频到视频生成
🔹通过指令进行高级运动和环境控制
微软新开源了这个 VibeVoice TTS模型很强
- 支持最多生成 90 分钟时长
- 最多4 个人的对谈语音,以往模型只能生成两个
- 支持中文,而且中文效果不错
- 支持生成带背景音乐的播客音频
模型下载:https://huggingface.co/microsoft/VibeVoice-1.5B
- 支持最多生成 90 分钟时长
- 最多4 个人的对谈语音,以往模型只能生成两个
- 支持中文,而且中文效果不错
- 支持生成带背景音乐的播客音频
模型下载:https://huggingface.co/microsoft/VibeVoice-1.5B