GPT-5.6 : comment deux réglages API ont triplé les scores sur ARC-AGI-3
Deux réglages de l'API OpenAI ont permis à GPT-5.6 de tripler ses scores sur le benchmark ARC-AGI-3。
Deux réglages de l'API OpenAI ont permis à GPT-5.6 de tripler ses scores sur le benchmark ARC-AGI-3。
L'équipe créative d'OpenAI utilise Codex pour créer des outils créatifs sur mesure。
Le routage de modèles dans les systèmes agentiques n'est pas un problème de classification mais d'optimisation système。
ChatGPT Work prend en charge des workflows de data science, notamment les briefs de root cause。
ChatGPT Work propose des workflows pratiques pour les équipes commerciales, couvrant les briefs de pipeline。
ChatGPT se prend en main en démarrant une première conversation, avec des usages simples pour écrire。
Hugging Face 博客发布« Profiling in PyTorch »系列第三部分, 用 profiler 剖析 attention 的五步原始操作 (matmul。
PRX détaille dans son Part 4 la stratégie de données derrière son modèle de 7B 。
Des ingénieurs d'OpenAI ont utilisé l'analyse de core dumps à grande échelle pour diagnostiquer des crashs d'infrastructure rares。
Hugging Face explique comment démarrer un endpoint LLM privé compatible OpenAI sur son infrastructure avec une seule commande hf jobs run。
Motif de la recommandation :Un guide pas à pas pour lancer un serveur vLLM compatible OpenAI sur HF Jobs, avec commandes, tarifs et cas d'usage agent.
Hugging Face fait passer la publication de huggingface_hub d'un rythme de 4 à 6 semaines à une fois par semaine via un unique workflow GitHub Actions. La chaîne combine OpenCode。
Motif de la recommandation :Le texte détaille une chaîne CI de publication hebdomadaire avec garde-fous déterministes et relecture humaine, une méthode transférable à d'autres bibliothèques Python.
L'équipe Chrome de Google expérimente la Cross-Origin Storage API (COS) dans Transformers.js pour éliminer les téléchargements et stockages dupliqués de ressources de modèles et de runtimes Wasm entre origines. Le cache navigateur étant isolé par origine via une Network Isolation Key, un même modèle comme Xenova/whisper-tiny.en peut être retéléchargé (177 MB dans l'exemple) sur chaque site, et le fichier Wasm partagé ort-wasm-simd-threaded.asyncify.wasm (4 733 kB) est lui aussi rechargé. L'API COS, encore à l'état de proposition non finalisée et non implémentée nativement, identifie les fichiers par hash cryptographique plutôt que par URL, et peut être testée via une extension injectant le polyfill navigator.crossOriginStorage.
Jason Liu utilise Codex pour préserver le contexte。
L'équipe Hugging Face présente localpager, un système de triage des issues et PR du dépôt OpenClaw utilisant des modèles locaux gemma-4-26b-a4b et qwen3.6-35b-a3b dans un harnais d'agent avec sortie structurée et un shell restreint en lecture seule. Sur un jeu d'évaluation de 330 lignes, Qwen obtient une précision de 0,831 et un exact match de 0,540, tandis que Gemma atteint un rappel de 0,905 avec 1,41 seconde par ligne à concurrence 16. Le système est semi-agentique : le classement est confié au modèle local, tandis que l'envoi des notifications Discord suit des règles déterministes, et une passe GPT-5.5 toutes les 2 heures sert de juge pour mesurer les faux positifs et faux négatifs.
Motif de la recommandation :L'article détaille une architecture de triage semi-agentique avec modèles locaux, incluant les métriques comparatives et les compromis de déploiement.
Hugging Face publie une analyse comparative des techniques de fine-tuning paramétrique efficace (PEFT) et conclut que LoRA。
Motif de la recommandation :Les benchmarks comparatifs de la bibliothèque PEFT montrent que LoRA n'est pas toujours le meilleur compromis, avec des chiffres et des configurations transférables.
AWS publie Strands Robots, un SDK open source (Apache 2.0) qui expose la pile LeRobot sous forme d'AgentTools composables dans un agent Strands unique. Le billet détaille cinq étapes 。
Motif de la recommandation :Présente un flux complet de l'entraînement au déploiement matériel via un agent unique, avec des exemples de code exécutables et des considérations de sécurité.
L'astrophysicien Chi-kwan Chan utilise Codex pour construire des simulations de trous noirs destinées à l'étude de la physique extrême et à tester la théorie de la relativité générale d'Einstein. Codex sert ici d'outil de développement des simulations, et non de modèle de calcul physique.
PyTorch 官方博客发布性能分析系列第二篇, 用 nn.Linear 替换手写的 matmul-add 并堆叠三层构成 MLP, 在 NVIDIA A100-SXM4-80GB 上对比 eager 与 torch.compile 的 profiler trace. nn.Linear 会先做 aten。
Un agent de codage a construit une galerie 3D des monuments de Paris en appelant directement deux Hugging Face Spaces。
Motif de la recommandation :L'auteur montre comment un agent enchaîne deux Spaces Hugging Face via agents.md pour produire des splats 3D à partir de simples prompts, une méthode directement réutilisable.
Hugging Face explique comment faire tourner les jobs GitHub Actions sur Hugging Face Jobs via le pont huggingface/jobs-actions。
Motif de la recommandation :Un guide pas à pas pour déplacer la CI GitHub vers Hugging Face Jobs, avec les chiffres de temps d'exécution obtenus sur Trackio.
Braintrust utilise Codex avec GPT-5.5 pour transformer les demandes clients en code et accélérer l'expérimentation. Les ingénieurs de Braintrust s'appuient sur Codex couplé à GPT-5.5 pour exécuter plus rapidement leurs expériences et leurs tâches de développement.
Hugging Face publie un guide débutant consacré à torch.profiler, premier volet d'une série sur le profilage PyTorch. Le tutoriel détaille la configuration du profileur。
Hugging Face détaille comment faire tourner entièrement en local la conversation vocale de Reachy Mini。
Motif de la recommandation :Guide pas à pas pour exécuter localement toute la chaîne vocale de Reachy Mini, avec composants recommandés et options de déploiement interchangeables.
Hugging Face 发布了一份 AI Agent 术语表, 重点厘清 harness 与 scaffold 等常被混用的概念. 文章将 harness 定义为 agent 内部的执行层。
Les ingénieurs de Ramp utilisent Codex avec GPT-5.5 pour la revue de code et l'amélioration des livraisons, obtenant des retours substantiels en quelques minutes au lieu de plusieurs heures.
ChatGPT Work permet de mettre en place des flux de travail opérationnels pour rédiger des briefs d'initiative。
Hugging Face détaille comment séparer les charges CPU et GPU pour accélérer l'inférence LLM。
Motif de la recommandation :Décrypte le pipeline asynchrone du continuous batching avec streams, événements et carry-over, et documente un gain mesuré de 22 % sur un cas reproductible.
ChatGPT Work propose des flux de travail pratiques pour la finance, couvrant le reporting, l'analyse des écarts, les prévisions, les revues mensuelles et les livrables décisionnels.
AWS 发布系列文章, 解析基础模型训练与推理在 AWS 上的分层架构, 涵盖加速计算, 高带宽低延迟网络与分布式存储三大基础设施模块. 文章指出扩展规律已从单一预训练曲线演变为预训练。
PipelineRL a aligné vLLM V1 sur sa référence V0 après avoir corrigé quatre points 。
OpenAI a publié cette semaine sur le Hub Privacy Filter。
OpenAI présente ChatGPT Work, un ensemble de workflows pratiques destinés aux tâches récurrentes。
Le guide explique comment faire tourner une IA locale dans une extension Chrome sous Manifest V3 avec Transformers.js。
OpenAI 在 Responses API 中引入 WebSockets, 用于加速 agentic 工作流. 文章深入剖析 Codex agent loop, 说明 WebSockets 与连接级缓存如何降低 API 开销并改善模型延迟.
Le blog Hugging Face explique comment entraîner ou affiner des modèles d'embedding et de reranker multimodaux avec la bibliothèque Sentence Transformers。
OpenAI présente un guide d'utilisation de ChatGPT pour la recherche, couvrant la collecte de sources。
OpenAI présente ChatGPT comme outil destiné aux équipes opérationnelles, pour rationaliser les workflows。
OpenAI présente un guide d'utilisation de ChatGPT pour l'écriture, couvrant la rédaction。
OpenAI présente ChatGPT pour les équipes marketing, un guide pratique pour planifier des campagnes。
ChatGPT peut être utilisé pour brainstormer, organiser sa réflexion et transformer des concepts bruts en plans structurés et actionnables. Le contenu détaille comment exploiter ChatGPT dans ce processus, de la génération d'idées à leur structuration.