Aller au contenu
  1. Hugging Face Blog60

    Multiverse Computing 提出让知识蒸馏可大规模运行的低成本方法

    Multiverse Computing 发布论文« Efficient Knowledge Distillation for LLMs: Offline Top-K Logits and a Fused Chunked KL Loss »。

    Motif de la recommandation :提出离线 top-K logits 缓存与融合分块 KL 损失两项系统改动, 把长上下文蒸馏显存从数百 GB 降到单卡可跑.

  1. OpenAI News60

    OpenAI publie gpt-oss-safeguard-120b et gpt-oss-safeguard-20b

    OpenAI publie gpt-oss-safeguard-120b et gpt-oss-safeguard-20b。

    Motif de la recommandation :Deux modèles ouverts de raisonnement dédiés au marquage de contenu selon une politique fournie, avec évaluations de sécurité comparées aux gpt-oss de base.

  1. OpenAI News78

    OpenAI apprend Montezuma's Revenge à un agent à partir d'une seule démonstration

    OpenAI a entraîné un agent à atteindre un score élevé de 74 500 sur Montezuma's Revenge à partir d'une seule démonstration humaine。

    Motif de la recommandation :L'article explique comment un agent atteint 74 500 points sur Montezuma's Revenge à partir d'une seule démonstration, avec un algorithme simple fondé sur PPO.

Fin de la liste