学界 | 百度提出冷聚变方法：使用语言模型训练Seq2Seq模型 - 专知

会员服务 ·

0

学界 | 百度提出冷聚变方法：使用语言模型训练Seq2Seq模型

2017 年 8 月 26 日 机器之心

选自arXiv

机器之心编译

参与：路雪、蒋思源

近日，百度研究院发表论文提出冷聚变（Cold Fusion）方法，即在 Seq2Seq 模型训练过程中加入语言模型，实现更快地收敛、更好的泛化，以及仅需少量标注数据即可实现向新域的完全迁移。机器之心对这篇论文进行了介绍。

论文地址：https://arxiv.org/abs/1708.06426

摘要：带有注意力机制的序列到序列（Seq2Seq）模型在多项生成自然语言句子的任务中表现优秀，如机器翻译、图像字幕生成和语音识别。在以语言模型的形式利用非标注数据后，其性能进一步提高。在本研究中，我们提供了一种冷聚变（Cold Fusion）方法，并展示该方法在语音识别中的有效性。我们展示了使用冷聚变方法的 Seq2Seq 模型能够更好地利用语言信息，并且能够实现（1）更快收敛、更好的泛化；（2）使用少于 10% 的标注数据进行训练时能几乎完成向新的域的完全迁移。

表 1. 深度聚变（Deep Fusion）和冷聚变的预测示例。

图 1. 基线模型（橙色）和我们提出的模型（紫色）在开发集上的交叉熵损失和迭代数之间的函数关系。使用语言模型的训练可以一定程度上加速收敛。

表 3. 论文中讨论的不同模型的语音识别结果。

表 4. 解码器维度对该模型的性能影响。冷聚变模型的性能随着解码器变小而缓慢下降，这证明冷聚变模型的有效任务能力比无聚变的模型大得多。

表 5. 微调后的声学模型在目标训练数据的子集上的结果。最后一行代表在所有目标域数据上进行训练的注意力模型。

结论

在该研究中，我们展示了一种新型 Seq2Seq 通用模型架构，其解码器和预训练的语言模型一起训练。我们研究并确认，架构变化对该模型充分利用语言模型中的信息至关重要，这也帮助模型实现更好地泛化；通过利用 RNN 语言模型，冷聚变模型产生的词错率比深度聚变模型低 18%。此外，我们证明冷聚变模型能够更轻松地迁移至新的域，仅需要 10% 的标注数据，即几乎可完全迁移至新的域。

本文为机器之心编译，转载请联系本公众号获得授权。

✄------------------------------------------------

加入机器之心（全职记者/实习生）：hr@jiqizhixin.com

投稿或寻求报道：content@jiqizhixin.com

广告&商务合作：bd@jiqizhixin.com

登录查看更多

2

相关内容

冷聚变

【ICML2020-伯克利】反直觉！大模型重压缩提升Transformer的训练和推理效率，47页ppt

【ICML2020-伯克利】反直觉！大模型重压缩提升Transformer的训练和推理效率，47页ppt

专知会员服务

70+阅读 · 2020年7月1日

【IJCAI2020-Facebook】利用弱标记数据对声音进行大规模的视听学习

【IJCAI2020-Facebook】利用弱标记数据对声音进行大规模的视听学习

专知会员服务

19+阅读 · 2020年6月3日

【ACL2020-MIT-韩松】用于高效自然语言处理的硬件感知Transformer

【ACL2020-MIT-韩松】用于高效自然语言处理的硬件感知Transformer

专知会员服务

24+阅读 · 2020年5月29日

基于多头注意力胶囊网络的文本分类模型

基于多头注意力胶囊网络的文本分类模型

专知会员服务

78+阅读 · 2020年5月24日

【CVPR2020-百度】用于视觉识别的门控信道变换

【CVPR2020-百度】用于视觉识别的门控信道变换

专知会员服务

13+阅读 · 2020年3月30日

【Amazon】使用预先训练的Transformer模型进行数据增强

【Amazon】使用预先训练的Transformer模型进行数据增强

专知会员服务

57+阅读 · 2020年3月6日

谷歌提出“T5” 新NLP模型，突破迁移学习局限，多基准测试达SOTA！

谷歌提出“T5” 新NLP模型，突破迁移学习局限，多基准测试达SOTA！

专知会员服务

41+阅读 · 2020年2月26日

【上海交大-ICASSP2020】Transformer端到端的多说话人语音识别

【上海交大-ICASSP2020】Transformer端到端的多说话人语音识别

专知会员服务

51+阅读 · 2020年2月16日

【Google AI新论文】REALM:检索增强语言模型预训练，QA的SOTA提升4-16%准确性

【Google AI新论文】REALM:检索增强语言模型预训练，QA的SOTA提升4-16%准确性

专知会员服务

45+阅读 · 2020年2月12日

【中科院自动化所】序列到序列语音识别的无监督预训练（Unsupervised pre-training for sequence to sequence speech recognition）

【中科院自动化所】序列到序列语音识别的无监督预训练（Unsupervised pre-training for sequence to sequence speech recognition）

专知会员服务

33+阅读 · 2020年1月5日

中科院自动化所提出 BIFT 模型：面向自然语言生成，同步双向推断

中科院自动化所提出 BIFT 模型：面向自然语言生成，同步双向推断

AI科技评论

12+阅读 · 2019年5月2日

CVPR 2019 | 用异构卷积训练深度CNN：提升效率而不损准确度

CVPR 2019 | 用异构卷积训练深度CNN：提升效率而不损准确度

计算机视觉life

6+阅读 · 2019年3月25日

【学界】CVPR 2019 | 用异构卷积训练深度CNN：提升效率而不损准确度

【学界】CVPR 2019 | 用异构卷积训练深度CNN：提升效率而不损准确度

GAN生成式对抗网络

8+阅读 · 2019年3月18日

赛尔原创 | COLING 2018 对话语义理解的序列到序列数据增强

赛尔原创 | COLING 2018 对话语义理解的序列到序列数据增强

哈工大SCIR

10+阅读 · 2018年8月20日

IJCAI 2018 | 腾讯知文等提出新型生成式摘要模型：结合主题信息和强化训练生成更优摘要

IJCAI 2018 | 腾讯知文等提出新型生成式摘要模型：结合主题信息和强化训练生成更优摘要

机器之心

12+阅读 · 2018年5月18日

学界 | 面向无监督任务：DeepMind提出神经离散表示学习生成模型VQ-VAE

学界 | 面向无监督任务：DeepMind提出神经离散表示学习生成模型VQ-VAE

机器之心

6+阅读 · 2017年11月10日

利用RNN训练Seq2Seq已经成为过去，CNN才是未来？

利用RNN训练Seq2Seq已经成为过去，CNN才是未来？

AI100

7+阅读 · 2017年10月31日

学界 | 词嵌入2017年进展全面梳理：趋势和未来方向

学界 | 词嵌入2017年进展全面梳理：趋势和未来方向

机器之心

4+阅读 · 2017年10月24日

学界 | 神经混合模型：提升模型性能，显著降低困惑度

学界 | 神经混合模型：提升模型性能，显著降低困惑度

机器之心

7+阅读 · 2017年9月25日

爆款论文提出简单循环单元SRU：像CNN一样快速训练RNN（附开源代码）

爆款论文提出简单循环单元SRU：像CNN一样快速训练RNN（附开源代码）

机器之心

3+阅读 · 2017年9月12日

Exploring RNN-Transducer for Chinese Speech Recognition

Arxiv

4+阅读 · 2019年4月23日

SlowFast Networks for Video Recognition

SlowFast Networks for Video Recognition

Arxiv

4+阅读 · 2019年4月18日

CoQA: A Conversational Question Answering Challenge

CoQA: A Conversational Question Answering Challenge

Arxiv

7+阅读 · 2018年8月21日

End-to-end Speech Recognition with Word-based RNN Language Models

End-to-end Speech Recognition with Word-based RNN Language Models

Arxiv

3+阅读 · 2018年8月8日

A Stochastic Decoder for Neural Machine Translation

Arxiv

5+阅读 · 2018年5月28日

Deep Reinforcement Learning for Page-wise Recommendations

Arxiv

8+阅读 · 2018年5月7日

Discrete Autoencoders for Sequence Models

Arxiv

6+阅读 · 2018年1月29日

State-of-the-art Speech Recognition With Sequence-to-Sequence Models

Arxiv

7+阅读 · 2018年1月18日

TernausNet: U-Net with VGG11 Encoder Pre-Trained on ImageNet for Image Segmentation

Arxiv

5+阅读 · 2018年1月17日

Mitigating the Impact of Speech Recognition Errors on Chatbot using Sequence-to-Sequence Model

Arxiv

4+阅读 · 2017年12月2日

VIP会员

相关主题

相关VIP内容

【ICML2020-伯克利】反直觉！大模型重压缩提升Transformer的训练和推理效率，47页ppt

【ICML2020-伯克利】反直觉！大模型重压缩提升Transformer的训练和推理效率，47页ppt

专知会员服务

70+阅读 · 2020年7月1日

【IJCAI2020-Facebook】利用弱标记数据对声音进行大规模的视听学习

【IJCAI2020-Facebook】利用弱标记数据对声音进行大规模的视听学习

专知会员服务

19+阅读 · 2020年6月3日

【ACL2020-MIT-韩松】用于高效自然语言处理的硬件感知Transformer

【ACL2020-MIT-韩松】用于高效自然语言处理的硬件感知Transformer

专知会员服务

24+阅读 · 2020年5月29日

基于多头注意力胶囊网络的文本分类模型

基于多头注意力胶囊网络的文本分类模型

专知会员服务

78+阅读 · 2020年5月24日

【CVPR2020-百度】用于视觉识别的门控信道变换

【CVPR2020-百度】用于视觉识别的门控信道变换

专知会员服务

13+阅读 · 2020年3月30日

【Amazon】使用预先训练的Transformer模型进行数据增强

【Amazon】使用预先训练的Transformer模型进行数据增强

专知会员服务

57+阅读 · 2020年3月6日

谷歌提出“T5” 新NLP模型，突破迁移学习局限，多基准测试达SOTA！

谷歌提出“T5” 新NLP模型，突破迁移学习局限，多基准测试达SOTA！

专知会员服务

41+阅读 · 2020年2月26日

【上海交大-ICASSP2020】Transformer端到端的多说话人语音识别

【上海交大-ICASSP2020】Transformer端到端的多说话人语音识别

专知会员服务

51+阅读 · 2020年2月16日

【Google AI新论文】REALM:检索增强语言模型预训练，QA的SOTA提升4-16%准确性

【Google AI新论文】REALM:检索增强语言模型预训练，QA的SOTA提升4-16%准确性

专知会员服务

45+阅读 · 2020年2月12日

【中科院自动化所】序列到序列语音识别的无监督预训练（Unsupervised pre-training for sequence to sequence speech recognition）

【中科院自动化所】序列到序列语音识别的无监督预训练（Unsupervised pre-training for sequence to sequence speech recognition）

专知会员服务

33+阅读 · 2020年1月5日

热门VIP内容

开通专知VIP会员享更多权益服务

【ICML2025】用于可扩展持续强化学习的自组合策略

图结构遇上智能体：分类方法、研究进展与未来机遇

2024年军事智能领域科技发展综述

【HKUST博士论文】知识图谱推理的进展：复杂查询应答与逻辑假设生成的创新方法

相关资讯

中科院自动化所提出 BIFT 模型：面向自然语言生成，同步双向推断

中科院自动化所提出 BIFT 模型：面向自然语言生成，同步双向推断

AI科技评论

12+阅读 · 2019年5月2日

CVPR 2019 | 用异构卷积训练深度CNN：提升效率而不损准确度

CVPR 2019 | 用异构卷积训练深度CNN：提升效率而不损准确度

计算机视觉life

6+阅读 · 2019年3月25日

【学界】CVPR 2019 | 用异构卷积训练深度CNN：提升效率而不损准确度

【学界】CVPR 2019 | 用异构卷积训练深度CNN：提升效率而不损准确度

GAN生成式对抗网络

8+阅读 · 2019年3月18日

赛尔原创 | COLING 2018 对话语义理解的序列到序列数据增强

赛尔原创 | COLING 2018 对话语义理解的序列到序列数据增强

哈工大SCIR

10+阅读 · 2018年8月20日

IJCAI 2018 | 腾讯知文等提出新型生成式摘要模型：结合主题信息和强化训练生成更优摘要

IJCAI 2018 | 腾讯知文等提出新型生成式摘要模型：结合主题信息和强化训练生成更优摘要

机器之心

12+阅读 · 2018年5月18日

学界 | 面向无监督任务：DeepMind提出神经离散表示学习生成模型VQ-VAE

学界 | 面向无监督任务：DeepMind提出神经离散表示学习生成模型VQ-VAE

机器之心

6+阅读 · 2017年11月10日

利用RNN训练Seq2Seq已经成为过去，CNN才是未来？

利用RNN训练Seq2Seq已经成为过去，CNN才是未来？

AI100

7+阅读 · 2017年10月31日

学界 | 词嵌入2017年进展全面梳理：趋势和未来方向

学界 | 词嵌入2017年进展全面梳理：趋势和未来方向

机器之心

4+阅读 · 2017年10月24日

学界 | 神经混合模型：提升模型性能，显著降低困惑度

学界 | 神经混合模型：提升模型性能，显著降低困惑度

机器之心

7+阅读 · 2017年9月25日

爆款论文提出简单循环单元SRU：像CNN一样快速训练RNN（附开源代码）

爆款论文提出简单循环单元SRU：像CNN一样快速训练RNN（附开源代码）

机器之心

3+阅读 · 2017年9月12日

相关论文

Exploring RNN-Transducer for Chinese Speech Recognition

Arxiv

4+阅读 · 2019年4月23日

SlowFast Networks for Video Recognition

SlowFast Networks for Video Recognition

Arxiv

4+阅读 · 2019年4月18日

CoQA: A Conversational Question Answering Challenge

CoQA: A Conversational Question Answering Challenge

Arxiv

7+阅读 · 2018年8月21日

End-to-end Speech Recognition with Word-based RNN Language Models

End-to-end Speech Recognition with Word-based RNN Language Models

Arxiv

3+阅读 · 2018年8月8日

A Stochastic Decoder for Neural Machine Translation

Arxiv

5+阅读 · 2018年5月28日

Deep Reinforcement Learning for Page-wise Recommendations

Arxiv

8+阅读 · 2018年5月7日

Discrete Autoencoders for Sequence Models

Arxiv

6+阅读 · 2018年1月29日

State-of-the-art Speech Recognition With Sequence-to-Sequence Models

Arxiv

7+阅读 · 2018年1月18日

TernausNet: U-Net with VGG11 Encoder Pre-Trained on ImageNet for Image Segmentation

Arxiv

5+阅读 · 2018年1月17日

Mitigating the Impact of Speech Recognition Errors on Chatbot using Sequence-to-Sequence Model

Arxiv

4+阅读 · 2017年12月2日

大家都在搜

大型语言模型

斯坦福博士论文

无人机系统

软件无线电

久别重逢话双塔

论文浅尝 - ICLR2020 | 通过神经逻辑归纳学习有效地解释

微信扫码咨询专知VIP会员