Sora核心技术框架DiT新版本SiT! 质量、速度、灵活性更好的扩散Transformer

转载机器之心****编辑：杜伟好的研究不会被埋没，只会历久弥新。

虽然已经发布近一周时间，OpenAI 视频生成大模型 Sora 的影响仍在继续！

其中，Sora 研发负责人之一 Bill Peebles 与纽约大学助理教授谢赛宁撰写的 DiT（扩散 Transformer）论文《Scalable Diffusion Models with Transformers》被认为是此次 Sora 背后的重要技术基础之一。该论文被 ICCV 2023 接收。

论文地址：https://arxiv.org/pdf/2212.09748v2.pdf * GitHub 地址：https://github.com/facebookresearch/DiT

这两天，DiT 论文和 GitHub 项目的热度水涨船高，重新收获大量关注。

论文出现在 PapersWithCode 的 Trending Research 榜单上，星标数量已近 2700；还登上了 GitHub Trending 榜单，星标数量每日数百增长，Star 总量已超 3000。

来源：https://paperswithcode.com/

来源：https://github.com/facebookresearch/DiT

这篇论文最早的版本是 2022 年 12 月，2023 年 3 月更新了第二版。当时，扩散模型在图像生成方面取得了惊人的成果，几乎所有这些模型都使用卷积 U-Net 作为主干。

因此，论文的目的是探究扩散模型中架构选择的意义，并为未来的生成模型研究提供经验基线。该研究表明，U-Net 归纳偏置对扩散模型的性能不是至关重要的，并且可以很容易地用标准设计（如 transformer）取代。

具体来说，研究者提出了一种基于 transformer 架构的新型扩散模型 DiT，并训练了潜在扩散模型，用对潜在 patch 进行操作的 Transformer 替换常用的 U-Net 主干网络。他们通过以 Gflops 衡量的前向传递复杂度来分析扩散 Transformer (DiT) 的可扩展性。

研究者尝试了四种因模型深度和宽度而异的配置：DiT-S、DiT-B、DiT-L 和 DiT-XL。

他们发现，通过增加 Transformer 深度 / 宽度或增加输入 token 数量，具有较高 Gflops 的 DiT 始终具有较低的 FID。

除了良好的可扩展性之外，DiT-XL/2 模型在 class-conditional ImageNet 512×512 和 256×256 基准上的性能优于所有先前的扩散模型，在后者上实现了 2.27 的 FID SOTA 数据。

质量、速度、灵活性更好的 SiT

此外，DiT 还在今年 1 月迎来了升级！谢赛宁及团队推出了 SiT（Scalable Interpolant Transformer，可扩展插值 Tranformer），相同的骨干实现了更好的质量、速度和灵活性。

谢赛宁表示，SiT 超越了标准扩散并通过插值来探索更广阔的设计空间。

该论文标题为《SiT: Exploring Flow and Diffusion-based Generative Models with Scalable Interpolant Transformers》。

论文地址：https://arxiv.org/pdf/2401.08740.pdf * GitHub 地址：https://github.com/willisma/SiT

简单来讲，SiT 将灵活的插值框架集成到了 DiT 中，从而能够对图像生成中的动态传输进行细微的探索。SiT 在 ImageNet 256 的 FID 为 2.06，将基于插值的模型推向了新的高度。

论文一作、纽约大学本科生 Nanye Ma 对这篇论文进行了解读。本文认为，随机插值为扩散和流提供了统一的框架。但又注意到，基于 DDPM（去噪扩散概率模型）的 DiT 与较新的基于插值的模型之间存在性能差异。因此，研究者想要探究性能提升的来源是什么？

他们通过设计空间中的一系列正交步骤，逐渐地从 DiT 模型过渡到 SiT 模型来解答这一问题。同时仔细评估了每个远离扩散模型的举措对性能的影响。

研究者发现，插值和采样器对性能的影响最大。当将插值（即分布路径）从方差保留切换到线性以及将采样器从确定性切换到随机性时，他们观察到了巨大的改进。

对于随机采样，研究者表明扩散系数不需要在训练和采样之间绑定，在推理时间方面可以有很多选择。同时确定性和随机采样器在不同的计算预算下各有其优势。

最后，研究者将 SiT 描述为连续、速度可预测、线性可调度和 SDE 采样的模型。与扩散模型一样，SiT 可以实现性能提升，并且优于 DiT。

更多关于 DiT 和 SiT 的内容请参阅原始论文。

成为VIP会员查看完整内容

相关内容

Sora

关注 14

Sora是OpenAI发布的一个AI模型，可以从文本指令中创建现实和想象的视频。OpenAI发布首个文本生成视频模型Sora，在生成视频长度（60秒）和内容上表现突出，为AIGC发展过程中的一大里程碑事件，

Stable Diffusion 3论文终于发布，架构细节大揭秘，对复现Sora有帮助？附中英文报告

专知会员服务

53+阅读 · 2024年3月7日

通用人工智能6个层次！谷歌DeepMind提出《AGI的层次:在通往AGI的道路上的操作化进展》

专知会员服务

67+阅读 · 2023年11月9日

GPT-4 Turbo更强更便宜，GPTs、GPT商店最大亮点，这是OpenAI首个开发者日

专知会员服务

39+阅读 · 2023年11月7日

行业必读！GPT-V4重磅更新！微软最新测评报告（中英文双版，166页下载）

专知会员服务

101+阅读 · 2023年10月4日

用GPT-4实现可控文本图像生成，UC伯克利&微软提出新框架Control-GPT

专知会员服务

35+阅读 · 2023年6月3日

IJCAI2022开会了! 微软等《领域泛化Domain Generalization》教程，阐述DG最新进展，附PPT和视频

专知会员服务

60+阅读 · 2022年7月24日

自主机器智能！图灵奖得主Yann LeCun指明下一代AI方向

专知会员服务

54+阅读 · 2022年6月29日

【CVPR 2022】基于Tracklet查询和建议的高效视频实例分割，Efficient Video Instance Segmentation via Tracklet Query and Proposal

专知会员服务

16+阅读 · 2022年3月3日

TensorFlow开发者峰会2020 Keynote，TF2及其庞大的科研、工业生态圈

专知会员服务

26+阅读 · 2020年3月20日

重磅！Geoffrey Hinton新论文「视觉表示对比学习简单框架」自监督学习建立新SOTA-ImageNet准确率76.5%

专知会员服务

33+阅读 · 2020年2月15日

【SIGIR2020-斯坦福大学】一种新的BERT类信息检索模型-又好又快的ColBERT

专知

15+阅读 · 2020年4月28日

ICCV2019 | 高精度，高效率点云三维重建 PointMVSNet

计算机视觉life

23+阅读 · 2019年9月5日

最强NLP预训练模型库PyTorch-Transformers正式开源！支持6个预训练框架，27个预训练模型

AI前线

12+阅读 · 2019年7月22日

「合并」样本和标签? IBM 为多标签小样本图像分类带来新进展！| CVPR 2019

AI科技评论

13+阅读 · 2019年7月21日

TensorFlow官方发布剪枝优化工具：参数减少80%，精度几乎不变

量子位

11+阅读 · 2019年5月15日

TensorFlow产品级端到端机器学习平台TFX，图形界面可视化流水线

专知

21+阅读 · 2019年4月19日

Perseus-BERT——业内性能极致优化的BERT训练方案

云栖社区

15+阅读 · 2019年2月20日

最强NLP模型BERT喜迎PyTorch版！谷歌官方推荐，也会支持中文

量子位

13+阅读 · 2018年11月7日

【泡泡一分钟】终极SLAM？结合事件相机、RGB和IMU用于高动态、高速场景的鲁棒视觉SLAM

泡泡机器人SLAM

14+阅读 · 2018年4月2日

【下载】Python自然语言处理实战书籍和代码《Natural Language Processing in Action》

专知

41+阅读 · 2017年12月10日

中国地区生产率差距研究——基于异质性企业、劳动力与产业空间分布的视角

国家自然科学基金

1+阅读 · 2015年12月31日

ONSET图像数据统计重建关键技术研究

国家自然科学基金

0+阅读 · 2015年12月31日

MEMS数字地震检波器专用DSP芯片优化设计

国家自然科学基金

1+阅读 · 2015年12月31日

高频ZnO/IDT/SiO2/金刚石SAW乳腺癌抗原免疫传感器研究

国家自然科学基金

1+阅读 · 2015年12月31日

基于自主学习的Ad hoc Agent序贯决策研究

国家自然科学基金

45+阅读 · 2015年12月31日

以内容为中心的移动自组织社交网络缓存技术研究

国家自然科学基金

0+阅读 · 2015年12月31日

制造物联背景下面向多行为特性的企业RFID技术采纳行为研究

国家自然科学基金

0+阅读 · 2014年12月31日

面向CCMANET网络可证明安全命名与名字路由机制关键技术研究

国家自然科学基金

0+阅读 · 2014年12月31日

基于模型驱动的并发建模语言Apla+设计及其可靠性研究

国家自然科学基金

3+阅读 · 2014年12月31日

Ghrelin整合调控神经血管单元网络抑制脑缺血再灌注损伤并促进神经修复

国家自然科学基金

0+阅读 · 2014年12月31日

Is ChatGPT a Good Recommender? A Preliminary Study

Arxiv

171+阅读 · 2023年4月20日

A Survey on Graph Diffusion Models: Generative AI in Science for Molecule, Protein and Material

Arxiv

84+阅读 · 2023年4月4日

One Small Step for Generative AI, One Giant Leap for AGI: A Complete Survey on ChatGPT in AIGC Era

Arxiv

49+阅读 · 2023年4月4日

Choose Your Weapon: Survival Strategies for Depressed AI Academics

Arxiv

32+阅读 · 2023年3月31日

A Survey of Large Language Models

Arxiv

482+阅读 · 2023年3月31日

Unleashing the Power of Edge-Cloud Generative AI in Mobile Networks: A Survey of AIGC Services

Arxiv

148+阅读 · 2023年3月29日

ChatGPT is a Knowledgeable but Inexperienced Solver: An Investigation of Commonsense Problem in Large Language Models

Arxiv

62+阅读 · 2023年3月29日

Sparks of Artificial General Intelligence: Early experiments with GPT-4

Arxiv

51+阅读 · 2023年3月22日

A Complete Survey on Generative AI (AIGC): Is ChatGPT from GPT-4 to GPT-5 All You Need?

Arxiv

84+阅读 · 2023年3月21日

Data-centric Artificial Intelligence: A Survey

Arxiv

25+阅读 · 2023年3月17日

VIP会员