字节跳动推出全新音视频生成模型Alive:实现视听同步生成,性能对标商业SOTA
字节跳动旗下的 FoundationVision 团队发布了一款名为“Alive”的统一音视频生成模型。该模型基于 MMDiT 架构,能够在单一框架内同时支持文本生成视频与音频(T2VA)以及参考图像生成动画。Alive 引入了 TA-Cr...
标签索引
这个标签下有 1 篇文章。按时间回看相关判断与实践记录。
标签精选
字节跳动旗下的 FoundationVision 团队发布了一款名为“Alive”的统一音视频生成模型。该模型基于 MMDiT 架构,能够在单一框架内同时支持文本生成视频与音频(T2VA)以及参考图像生成动画。Alive 引入了 TA-Cr...