L'actualité IA du jour : sources officielles, Hacker News et arXiv
Les titres et résumés de cette page sont traduits automatiquement de l'anglais (hors ligne) et peuvent contenir des erreurs. L'original en lien fait foi.
La publicité à l'intérieur de ChatGPT continue de croître: OpenAI ajoute un format publicitaire visuel plus des outils de mesure, d'attribution et de convenance de la marque, ce qui compte tant pour les annonceurs que pour les utilisateurs quotidiens.
Un examen concret de la façon dont un laboratoire majeur prévoit de traiter les règles de l'UE en matière de validation de texte, y compris les cas où des filigranes s'appliquent et pourquoi l'accès à la détection commence par les chercheurs.
Un article rare qui vérifie ses propres affirmations principales : les auteurs signalent que la correction de leurs erreurs d'analyse a permis de réduire de 23,9 % les coûts à 4,3 %, ce qui constitue une mise en garde utile pour tous ceux qui évaluent les modèles d'acheminement des agents.
arXiv
Note de la rédaction: Les résumés ont été rédigés avec l'aide de l'IA à partir du texte de chaque éditeur et attendent une relecture humaine.
Entreprises et laboratoires d'IA
Billets des blogs officiels d'entreprises et de laboratoires publiés au cours des 7 derniers jours.
Original: Our approach to EU text provenance rules
OpenAI décrit comment il approche le filigrane texte en vertu des règles de l'UE: où les filigranes s'appliquent, comment fonctionne la détection, et pourquoi l'accès à la détection commence par les chercheurs.
Original: Building advertising for the way people use AI
OpenAI a introduit un nouveau format de publicité visuelle dans ChatGPT et des outils de mesure élargis, des partenariats d'attribution et des contrôles de la qualité pour les annonceurs.
Original: Together Link: open models in the harness you already use. Start with one command today.
Together AI's Together Link apporte des modèles ouverts tels que GLM 5.3 et Kimi K3 dans les équipes d'agents de codage déjà utilisées; Together dit qu'il peut réduire les dépenses de modèle de plus de 50%.
Together AI · · Résumé
Les sujets IA les plus suivis sur Hacker News
Sujets dont le titre concerne l'IA, classés par points sur les 36 dernières heures.
Sélection automatique des nouvelles soumissions, en privilégiant les articles listés à la fois en cs.AI, cs.CL et cs.LG. Ce n'est pas un classement de qualité.
Une évaluation jumelée d'un modèle de décision en régime ouvert et d'un modèle de décision en régime unique hébergé sur 11 points de décision d'agents a révélé que le modèle hébergé était plus précis sur 9 d'entre eux, et les auteurs ont corrigé plusieurs de leurs propres erreurs d'analyse.
Original: Right Order, Wrong Scale: Auditing LLM Judges for Occupational AI Measurement
Auditing 33 LLM-judge configurations against 45,796 worker ratings, the authors find judges can rank responses reasonably well yet estimate acceptance rates anywhere from 3.0% to 97.9%, versus 61.1% for matched workers.
arXiv · · Harry Lyu, Neil Thompson · cs.AI cs.CL cs.CY cs.LG · Résumé
Original: ROUTEAUDIT: Interaction-Aware Identification for Budgeted Multi-Verifier Routing
Les systèmes multi-vérificateurs adaptatifs sont fréquemment comparés par des écarts de qualité-coût, même lorsque le catalogue de vérificateurs, la disponibilité, la comptabilité, la filtration de l'information, ou le scoreur change avec la politique.
Original: FSPO: Policy-Consistent Risk and Pareto-Feasible Control for Budgeted LLM RL Post-Training
Le renforcement adaptatif LLM-learning post-training change plusieurs actuateurs de formation en ligne, y compris la température de déploiement, la taille du groupe, le clipping, la régularisation KL, l'allocation des vérificateurs et le budget de mise à jour.
Original: Large Language Continuous Diffusion Models
Malgré le succès des modèles linguistiques de diffusion discrètes (dLMs) pour un décodage parallèle rapide, leur espace non humide et haute dimension empêche la direction trajectorielle pour la raisonnement et l’accélération de la conclusion.
arXiv · · Zhihan Yang, Wei Guo, Jean-Marie Lemercier +14 · cs.CL cs.AI cs.LG · Extrait du résumé (arXiv, CC0)
Original: Not Until the Evidence Says So: Teaching LLM Investigators When to Close a Case
Cet article étudie quand les enquêteurs de la LLM devraient clore un cas, en utilisant 731 cas vérifiés d'accident, de défectuosité et de panne; il signale que même un modèle frontalier a surestimé ses preuves dans 91 % des réponses.
Original: Counterexample Generation via Per-Theorem Symbolic Verifiers: When Imitation Hurts and Reinforcement Repairs
Les grands modèles de langage résolvent souvent un théorème en avant mais ne parviennent pas à réfuter un faux étroitement apparenté : un écart de falsification qui supervisait le réglage fin ne se rapproche pas et peut s'aggraver activement.
Original: FinDialogLens: Event Extraction over Multi-Party Dialogue for Missed-Trade Identification in Financial Chatrooms
Les salons financiers multipartites sont essentiels pour les professionnels de la vente et du commerce, mais leur complexité rend la récupération manuelle des métiers manqués impossible : chaque demande de devis (RFQ) est un événement dont le prix final et le résultat commercial apparaissent...
arXiv · · Chin-Lun Fu, Hong Ni, Behrouz Madahian · cs.CL cs.AI · Extrait du résumé (arXiv, CC0)
Original: APDMem: Agent-Controlled Progressive Disclosure for Query-Adaptive Long-Term Memory
APDMem organise une longue histoire de conversation en quatre couches, des résumés thématiques jusqu'aux messages bruts, et fore plus profondément seulement lorsqu'une requête en a besoin; sur LongMemEval il rapporte des résultats forts tout en lisant environ 8% des conversations.
arXiv · · Chin-Lun Fu, Anagha Kulkarni, Hong Ni +1 · cs.CL cs.AI · Résumé
Le renforcement de l'apprentissage des récompenses vérifiables (RLVR) optimise généralement l'exactitude de la réponse, mais le comportement utile du modèle de langue exige également un raisonnement de haute qualité et des réponses concises.
arXiv · · Doseok Jang, Jon Ander Campos, Youran Qi · cs.LG cs.AI cs.CL · Extrait du résumé (arXiv, CC0)
Original: Are you Synthesizing or Recalling? Evaluating LLMs on Algorithmic Code Retrieval
Les grands modèles de langage (LLM) ont fait preuve d'une forte performance dans la génération de code, où le succès dépend à la fois du rappel des connaissances algorithmiques pertinentes et du raisonnement sur la façon de les appliquer.
arXiv · · Nickil Maveli, Antonio Vergari, Shay B. Cohen · cs.LG cs.AI cs.CL cs.PL · Extrait du résumé (arXiv, CC0)
Original: LEAP: Learning Efficient Action Proposals For LLM Agents
LEAP accélère les agents LLM en formant un petit modèle de rédacteur sur les propres séquences d'action du modèle cible afin que les actions proposées correspondent plus souvent, guidés par un cadre de latence pour les cycles d'action spéculatifs.