Aller au contenu
4mois16jourjeudi
4mois14jourmardi
  1. OpenAI News52

    OpenAI lance Microscope, une collection de visualisations pour huit modèles de vision

    OpenAI présente OpenAI Microscope, une collection de visualisations de chaque couche et neurone significatifs de huit « organismes modèles » de vision souvent étudiés en interprétabilité. L'outil vise à faciliter l'analyse des caractéristiques qui se forment à l'intérieur de ces réseaux neuronaux et à aider la communauté de recherche à mieux comprendre ces systèmes complexes.

12mois13jourvendredi
12mois5jourjeudi
12mois3jourmardi
11mois21jourjeudi
10mois15jourmardi
  1. OpenAI News78

    OpenAI 用机械手解魔方

    OpenAI 训练了一对神经网络, 让类人机械手解开魔方. 神经网络完全在模拟环境中训练, 使用与 OpenAI Five 相同的强化学习代码, 并搭配名为 Automatic Domain Randomization (ADR) 的新技术. 该系统能处理训练中从未见过的情况。

    Motif de la recommandation :展示了纯模拟训练的策略如何迁移到真实机械手, 并应对训练中未见的干扰, 对具身智能研究有参考价值.

10mois11jourvendredi
9mois19jourjeudi
  1. OpenAI News62

    OpenAI ajuste GPT-2 774M par les préférences humaines

    OpenAI a ajusté le modèle de langage GPT-2 de 774M paramètres à l'aide de retours humains pour diverses tâches。

    Motif de la recommandation :L'original expose les préférences humaines et le nombre d'annotations nécessaires pour différentes tâches, ce qui permet de comprendre le coût et les limites du fine-tuning par retour humain.

9mois17jourmardi
  1. OpenAI News62

    OpenAI 在多智能体交互中观察到工具使用的涌现

    OpenAI 在模拟捉迷藏环境中训练智能体, 观察到它们在游戏过程中逐步学会使用更复杂的工具, 并形成六种不同的策略与反策略, 其中一些策略是该环境原本未预设支持的. 研究指出, 这种在简单环境中自监督涌现出的复杂性, 进一步表明多智能体共同适应未来可能产生极其复杂且智能的行为.

    Motif de la recommandation :通过捉迷藏环境观察智能体自发形成六种策略与反策略, 为多智能体协同演化提供可复现的实验线索.

8mois22jourjeudi
7mois10jourmercredi
5mois23jourjeudi
4mois23jourmardi
4mois15jourlundi
3mois21jourjeudi
  1. OpenAI News22

    OpenAI 提出基于能量的模型隐式生成与泛化方法

    OpenAI 在基于能量的模型 (EBM)的稳定, 可扩展训练上取得进展, 其样本质量和泛化能力优于现有模型. EBM 的生成过程会消耗更多算力持续精炼答案, 在低温下可生成与 GAN 媲美的样本, 同时具备基于似然模型的模式覆盖保证. OpenAI 希望这些发现能推动对这一类模型的研究.

3mois6jourmercredi
3mois4jourlundi
  1. OpenAI News50

    Neural MMO : un environnement de jeu massivement multi-agents pour l'apprentissage par renforcement

    OpenAI publie Neural MMO, un environnement de jeu massivement multi-agents destiné aux agents d'apprentissage par renforcement. La plateforme prend en charge un nombre important et variable d'agents dans une tâche persistante et ouverte. La présence de nombreux agents et espèces favorise une meilleure exploration, la formation de niches divergentes et une compétence globale accrue.

2mois26jourmardi
2mois19jourmardi
  1. OpenAI News32

    La sécurité de l'IA a besoin des spécialistes des sciences sociales

    OpenAI publie un article affirmant que la recherche sur la sécurité à long terme de l'IA nécessite la collaboration de spécialistes des sciences sociales pour garantir le succès des algorithmes d'alignement lorsque de véritables humains sont impliqués. L'alignement des systèmes d'IA avancés sur les valeurs humaines exige de lever de nombreuses incertitudes liées à la psychologie de la rationalité, des émotions et des biais humains. OpenAI prévoit de recruter des spécialistes des sciences sociales pour travailler à plein temps sur ce sujet et entend stimuler la collaboration entre chercheurs en machine learning et en sciences sociales.

2mois14jourjeudi
12mois14jourvendredi
12mois6jourjeudi
  1. OpenAI News33

    OpenAI publie CoinRun pour quantifier la généralisation en apprentissage par renforcement

    OpenAI publie CoinRun, un environnement d'entraînement qui fournit une métrique pour la capacité d'un agent à transférer son expérience vers des situations nouvelles. CoinRun a déjà aidé à clarifier un puzzle de longue date en apprentissage par renforcement. L'environnement se situe à un niveau de complexité intermédiaire : plus simple que les jeux de plateforme traditionnels comme Sonic the Hedgehog, mais il reste un défi de généralisation sérieux pour les algorithmes de pointe.

11mois8jourjeudi
11mois7jourmercredi
10mois31jourmercredi
10mois22jourlundi
8mois23jourjeudi
8mois6jourlundi
7mois30jourlundi
7mois18jourmercredi
7mois9jourlundi
  1. OpenAI News58

    Glow : de meilleurs modèles génératifs réversibles

    OpenAI présente Glow, un modèle génératif réversible qui utilise des convolutions 1x1 inversibles. Il étend les travaux antérieurs sur les modèles génératifs réversibles et simplifie l'architecture. Le modèle peut générer des images réalistes à haute résolution, prend en charge un échantillonnage efficace et découvre des caractéristiques permettant de manipuler les attributs des données. Le code du modèle et un outil de visualisation en ligne sont publiés.

7mois4jourmercredi
  1. OpenAI News78

    OpenAI apprend Montezuma's Revenge à un agent à partir d'une seule démonstration

    OpenAI a entraîné un agent à atteindre un score élevé de 74 500 sur Montezuma's Revenge à partir d'une seule démonstration humaine。

    Motif de la recommandation :L'article explique comment un agent atteint 74 500 points sur Montezuma's Revenge à partir d'une seule démonstration, avec un algorithme simple fondé sur PPO.

6mois25jourlundi
6mois22jourvendredi
6mois11jourlundi
5mois25jourvendredi
  1. OpenAI News62

    OpenAI publie la version complète de Gym Retro

    OpenAI publie la version complète de Gym Retro, une plateforme de recherche en apprentissage par renforcement sur les jeux. Le nombre de jeux publics passe d'environ 70 jeux Atari et 30 jeux Sega à plus de 1000 jeux couvrant plusieurs émulateurs sous-jacents. OpenAI publie également l'outil utilisé pour ajouter de nouveaux jeux à la plateforme.

    Motif de la recommandation :OpenAI ouvre une plateforme d'apprentissage par renforcement sur plus de 1000 jeux et publie l'outil d'ajout de jeux, ce qui permet de mesurer l'évolution de l'échelle des environnements disponibles.

5mois16jourmercredi
  1. OpenAI News85

    OpenAI analyse la croissance exponentielle du calcul d'entraînement en IA

    OpenAI publie une analyse montrant que depuis 2012, la quantité de calcul utilisée dans les plus grands entraînements d'IA croît de façon exponentielle avec un temps de doublement de 3。

    Motif de la recommandation :L'analyse quantifie la croissance exponentielle du calcul d'entraînement depuis 2012 et son rythme de doublement, un repère pour situer les capacités des futurs systèmes.

5mois3jourjeudi
4mois18jourmercredi
  1. OpenAI News22

    OpenAI publie Evolved Policy Gradients, une approche de méta-apprentissage par évolution de la fonction de perte

    OpenAI publie Evolved Policy Gradients (EPG), une approche expérimentale de méta-apprentissage qui fait évoluer la fonction de perte des agents d'apprentissage afin de permettre un entraînement rapide sur de nouvelles tâches. Les agents entraînés avec EPG réussissent à l'évaluation des tâches de base hors de leur régime d'entraînement, comme apprendre à naviguer vers un objet situé du côté opposé de la pièce par rapport à sa position pendant l'entraînement.