语言自博弈：无需数据的训练方法 (Language Self-Play For Data-Free Training) - 专知论文

会员服务 ·

0

博弈 · 指令遵循 · 代码 · 基准 · 基准测试 ·

Language Self-Play For Data-Free Training

翻译：语言自博弈：无需数据的训练方法

Jakub Grudzien Kuba,Mengting Gu,Qi Ma,Yuandong Tian,Vijai Mohan,Jason Chen

Large language models (LLMs) have advanced rapidly in recent years, driven by scale, abundant high-quality training data, and reinforcement learning. Yet this progress faces a fundamental bottleneck: the need for ever more data from which models can continue to learn. In this work, we propose a reinforcement learning approach that removes this dependency by enabling models to improve without additional data. Our method leverages a game-theoretic framework of self-play, where a model's capabilities are cast as performance in a competitive game and stronger policies emerge by having the model play against itself-a process we call Language Self-Play (LSP). Experiments with Llama-3.2-3B-Instruct on instruction-following, mathematics, and coding benchmarks show that pretrained models can be effectively improved with self-play alone.

翻译：近年来，大型语言模型（LLMs）在规模扩展、高质量训练数据丰富以及强化学习的推动下取得了飞速进展。然而，这一进展面临一个根本性瓶颈：模型持续学习需要不断获取更多数据。本研究提出一种强化学习方法，通过使模型能够在无需额外数据的情况下实现自我提升，从而消除这一依赖。我们的方法利用自博弈的博弈论框架，将模型能力视为其在竞争性博弈中的表现，并通过让模型与自身对弈——我们称之为语言自博弈（LSP）的过程——来产生更强的策略。基于Llama-3.2-3B-Instruct模型在指令遵循、数学和代码生成基准测试上的实验表明，仅通过自博弈即可有效提升预训练模型的性能。

0

相关内容

LLM4SR：关于大规模语言模型在科学研究中的应用综述

LLM4SR：关于大规模语言模型在科学研究中的应用综述

专知会员服务

41+阅读 · 1月9日

【NeurIPS 2024】基于大型语言模型的三层学习用于时间序列OOD泛化

【NeurIPS 2024】基于大型语言模型的三层学习用于时间序列OOD泛化

专知会员服务

19+阅读 · 2024年10月13日

【CVPR2024】医学基础模型的低秩知识分解

【CVPR2024】医学基础模型的低秩知识分解

专知会员服务

35+阅读 · 2024年4月29日

UTC: 用于视觉对话的任务间对比学习的统一Transformer

UTC: 用于视觉对话的任务间对比学习的统一Transformer

专知会员服务

14+阅读 · 2022年5月4日

【Facebook AI】对抗性NLI:自然语言理解的新基准，Adversarial NLI: A New Benchmark for Natural Language Understanding

【Facebook AI】对抗性NLI:自然语言理解的新基准，Adversarial NLI: A New Benchmark for Natural Language Understanding

专知会员服务

11+阅读 · 2019年11月2日

【CVPR 2020 Oral】小样本类增量学习

【CVPR 2020 Oral】小样本类增量学习

专知

20+阅读 · 2020年6月26日

DeepMind：用PopArt进行多任务深度强化学习

DeepMind：用PopArt进行多任务深度强化学习

论智

29+阅读 · 2018年9月14日

机器翻译新时代：Facebook 开源无监督机器翻译模型和大规模训练语料

机器翻译新时代：Facebook 开源无监督机器翻译模型和大规模训练语料

机器学习研究会

12+阅读 · 2017年12月24日

语义分割中的深度学习方法全解：从FCN、SegNet到DeepLab

语义分割中的深度学习方法全解：从FCN、SegNet到DeepLab

炼数成金订阅号

26+阅读 · 2017年7月10日

MNIST入门：贝叶斯方法

MNIST入门：贝叶斯方法

Python程序员

23+阅读 · 2017年7月3日

分布式有监督学习的学习理论

国家自然科学基金

17+阅读 · 2015年12月31日

基于自主学习的Ad hoc Agent序贯决策研究

国家自然科学基金

46+阅读 · 2015年12月31日

高维数据下的模型平均方法

国家自然科学基金

6+阅读 · 2014年12月31日

面向时空变化的GIS数据模型

国家自然科学基金

6+阅读 · 2014年12月31日

面向汉语文本理解的语义计算方法

国家自然科学基金

8+阅读 · 2014年12月31日

Imperative Learning: A Self-supervised Neuro-Symbolic Learning Framework for Robot Autonomy

Arxiv

0+阅读 · 12月24日

GenEnv: Difficulty-Aligned Co-Evolution Between LLM Agents and Environment Simulators

Arxiv

0+阅读 · 12月23日

SPELL: Self-Play Reinforcement Learning for evolving Long-Context Language Models

Arxiv

0+阅读 · 12月22日

Neuro-Symbolic Control with Large Language Models for Language-Guided Spatial Tasks

Arxiv

0+阅读 · 12月19日

Parallelism Meets Adaptiveness: Scalable Documents Understanding in Multi-Agent LLM Systems

Arxiv

0+阅读 · 12月19日

VIP会员

文章信息

相关主题

相关VIP内容

LLM4SR：关于大规模语言模型在科学研究中的应用综述

LLM4SR：关于大规模语言模型在科学研究中的应用综述

专知会员服务

41+阅读 · 1月9日

【NeurIPS 2024】基于大型语言模型的三层学习用于时间序列OOD泛化

【NeurIPS 2024】基于大型语言模型的三层学习用于时间序列OOD泛化

专知会员服务

19+阅读 · 2024年10月13日

【CVPR2024】医学基础模型的低秩知识分解

【CVPR2024】医学基础模型的低秩知识分解

专知会员服务

35+阅读 · 2024年4月29日

UTC: 用于视觉对话的任务间对比学习的统一Transformer

UTC: 用于视觉对话的任务间对比学习的统一Transformer

专知会员服务

14+阅读 · 2022年5月4日

【Facebook AI】对抗性NLI:自然语言理解的新基准，Adversarial NLI: A New Benchmark for Natural Language Understanding

【Facebook AI】对抗性NLI:自然语言理解的新基准，Adversarial NLI: A New Benchmark for Natural Language Understanding

专知会员服务

11+阅读 · 2019年11月2日

热门VIP内容

开通专知VIP会员享更多权益服务

《用于水文建模应用的美国空军全球空陆天气开发模型数据流程：GALWEM采集系统v1.0与v2.0概述》最新报告

《MERLIN：面向推广资源与研究的国家数据管理平台》报告

人工智能与未来指挥

《未来自主协作系统的指挥与控制——2025年度报告》报告

相关资讯

【CVPR 2020 Oral】小样本类增量学习

【CVPR 2020 Oral】小样本类增量学习

专知

20+阅读 · 2020年6月26日

DeepMind：用PopArt进行多任务深度强化学习

DeepMind：用PopArt进行多任务深度强化学习

论智

29+阅读 · 2018年9月14日

机器翻译新时代：Facebook 开源无监督机器翻译模型和大规模训练语料

机器翻译新时代：Facebook 开源无监督机器翻译模型和大规模训练语料

机器学习研究会

12+阅读 · 2017年12月24日

语义分割中的深度学习方法全解：从FCN、SegNet到DeepLab

语义分割中的深度学习方法全解：从FCN、SegNet到DeepLab

炼数成金订阅号

26+阅读 · 2017年7月10日

MNIST入门：贝叶斯方法

MNIST入门：贝叶斯方法

Python程序员

23+阅读 · 2017年7月3日

相关论文

Imperative Learning: A Self-supervised Neuro-Symbolic Learning Framework for Robot Autonomy

Arxiv

0+阅读 · 12月24日

GenEnv: Difficulty-Aligned Co-Evolution Between LLM Agents and Environment Simulators

Arxiv

0+阅读 · 12月23日

SPELL: Self-Play Reinforcement Learning for evolving Long-Context Language Models

Arxiv

0+阅读 · 12月22日

Neuro-Symbolic Control with Large Language Models for Language-Guided Spatial Tasks

Arxiv

0+阅读 · 12月19日

Parallelism Meets Adaptiveness: Scalable Documents Understanding in Multi-Agent LLM Systems

Arxiv

0+阅读 · 12月19日

相关基金

分布式有监督学习的学习理论

国家自然科学基金

17+阅读 · 2015年12月31日

基于自主学习的Ad hoc Agent序贯决策研究

国家自然科学基金

46+阅读 · 2015年12月31日

高维数据下的模型平均方法

国家自然科学基金

6+阅读 · 2014年12月31日

面向时空变化的GIS数据模型

国家自然科学基金

6+阅读 · 2014年12月31日

面向汉语文本理解的语义计算方法

国家自然科学基金

8+阅读 · 2014年12月31日

微信扫码咨询专知VIP会员