Text-To-4D

Text-To-4D

Text-To-4D 是 Meta AI 的一个研究项目(MAV3D),能够根据文本描述生成三维动态场景。该方法使用了一个四维动态神经辐射场,通过查询文本到视频的扩散模型,优化了外观、密度和运动一致性。

与输出单一网格的静态三维生成器不同,Text-To-4D 生成的场景可以从任意摄像机角度观看,并可合成到其他三维环境中。该方法不需要三维或四维训练数据;其底层的文本到视频模型仅在文本-图像对和无标签视频上进行训练。

项目页面提供了文本到四维的演示样例,如“柯基犬玩球”,以及从静态照片到四维的图像转换。它是一个研究展示项目,不是带有公开 API 或注册功能的商业产品。对基于 NeRF 的动态场景生成感兴趣的研究人员和三维艺术家可以在网站上查看论文和样例输出。

主要功能:
  1. 通过MAV3D(Make-A-Video3D)从文本提示生成3D动态场景

  2. 4D动态NeRF,优化外观、密度和运动一致性

  3. 从任何摄像机位置和角度查看生成的场景

  4. 图像到4D模式将静态照片转换为动态视频场景

  5. 仅在文本-图像对和未标记视频上训练,无需3D/4D数据

  6. 在arXiv(2301.11280)发表的研究论文及交互演示样本

Pros:
  1. 开创性地仅用文本生成完整的3D动态场景

  2. 底层模型无需3D或4D训练数据

  3. 可以从任何摄像角度查看并合成到3D环境中

  4. 免费研究演示,带交互样本输出

Cons:
  1. 仅为研究演示,未提供公开生成API或工具

  2. 论文于2023年发表,未显示持续的商业开发

  3. 网站内容有限,仅有演示样本,无文档或用户支持

  4. 需要技术知识以复现论文中的结果

常见问题:

什么是Text-To-4D?

Text-To-4D是Meta AI的一种研究方法,称为MAV3D,能够根据文本描述生成三维动态场景。Text-To-4D使用由文本到视频扩散模型优化的4D动态神经辐射场,演示页面展示了可供探索的示例输出。

Text-To-4D免费使用吗?

Text-To-4D是一个托管在GitHub Pages上的免费研究演示,无需注册或付款。它没有公开API或商业产品;你可以查看示例生成内容并阅读论文,但无法通过网站生成自己的场景。

Text-To-4D是如何工作的?

Text-To-4D构建了一个4D动态NeRF,通过查询文本到视频的扩散模型来获取场景的外观、密度和运动。输出是一个可从任意摄像机角度观看的动态视频,并且可以合成到3D环境中。Text-To-4D还支持从单张输入照片生成4D场景。

谁开发了Text-To-4D?

Text-To-4D由Meta AI的研究人员开发,包括Uriel Singer、Shelly Sheynin、Adam Polyak等人。该工作于2023年以“Text-To-4D Dynamic Scene Generation”(arXiv:2301.11280)发表在arXiv上。

我可以用Text-To-4D生成自己的场景吗?

Text-To-4D演示页面展示了“跳舞的熊猫”和“航天飞机发射”等预生成样本,但没有提供公开的生成接口。Text-To-4D是一个研究展示;要实现该方法需要参考已发布的论文。

Text-To-4D和Make-A-Video有什么区别?

Make-A-Video从文本生成二维视频,而Text-To-4D(MAV3D)将其扩展到可从任意角度观看的完整三维动态场景。Text-To-4D增加了4D NeRF层,使输出可以合成到3D环境中,而不仅仅是观看平面视频。

定价:

免费

标签:

NeRF
Dynamic Scenes
Text to Video
Meta AI Research
4D Generation
Computer Vision
AI Videos
3D

使用的技术:

GitHub
Tailwind CSS

总体评分:

5.0 🏆

评论:

Give your opinion on Text-To-4D :-

Overall rating

Thanks

Join thousands of AI enthusiasts in the World of AI!

最佳免费 Text-To-4D 替代方案(和付费)

By Rishit