Reclame binnen ChatGPT blijft groeien: OpenAI is het toevoegen van een visuele advertentie formaat plus meting, attributie en merk-geschiktheid tools, die belangrijk zijn voor zowel marketeers als alledaagse gebruikers.
Een concrete blik op hoe één groot laboratorium van plan is om de EU-regels inzake tekstverbetering aan te pakken, onder meer waar watermerken van toepassing zijn en waarom detectietoegang begint bij onderzoekers.
Een zeldzame paper die zijn eigen kopclaims controleert: de auteurs melden dat de vaststelling van hun analysefouten een geclaimde kostenbesparing van 23,9% heeft teruggebracht tot 4,3%, een bruikbare voorzichtigheid voor iedereen die modellen voor het opsporen van stoffen beoordeelt.
arXiv
Noot van de redactie: De samenvattingen zijn met hulp van AI opgesteld op basis van de tekst van elke uitgever en wachten nog op menselijke controle.
Van AI-bedrijven en -labs
Berichten van officiële blogs van bedrijven en labs uit de afgelopen 7 dagen.
Origineel: Our approach to EU text provenance rules
OpenAI beschrijft hoe het tekstwatermerken benadert volgens de EU-regels: waar watermerken van toepassing zijn, hoe detectie werkt en waarom toegang tot detectie begint bij onderzoekers.
Origineel: Building advertising for the way people use AI
OpenAI introduceerde een nieuw visueel advertentieformaat in ChatGPT en uitgebreide meettools, attribution partnerships en brand-suitability controls voor adverteerders.
Origineel: Together Link: open models in the harness you already use. Start with one command today.
Samen brengt AI's Together Link open modellen zoals GLM 5.3 en Kimi K3 al in codeeragententeams; Samen zegt dat het model met meer dan 50% kan bezuinigen.
Together AI · · Samenvatting
Populaire AI-verhalen op Hacker News
Verhalen met AI-gerelateerde titels, gesorteerd op punten in de afgelopen 36 uur.
Origineel: Fast Models, Slow Evidence: A Paired and Self-Audited Evaluation of System-1 Decision Models for LLM Agent Harnesses
Een gekoppelde evaluatie van een open-gewicht en een gehost single-pass decision model over 11 agent decision points vond het gehost model nauwkeuriger op 9 van hen, noch slaan kans op nul-shot model routing, en de auteurs corrigeren een aantal van hun eigen analyse fouten.
Origineel: Right Order, Wrong Scale: Auditing LLM Judges for Occupational AI Measurement
Auditing 33 LLM-rechter configuraties tegen 45.796 werknemers ratings, de auteurs vinden rechters kunnen de antwoorden redelijk goed maar schatten acceptatiepercentages overal van 3,0% tot 97,9%, versus 61,1% voor geëvenaarde werknemers.
arXiv · · Harry Lyu, Neil Thompson · cs.AI cs.CL cs.CY cs.LG · Samenvatting
Origineel: ROUTEAUDIT: Interaction-Aware Identification for Budgeted Multi-Verifier Routing
Adaptive multi-verifier systemen worden vaak vergeleken door middel van endpoint quality-cost hiaten, zelfs wanneer de verificateur catalogus, beschikbaarheid, boekhouding, informatiefiltratie, of scorer veranderingen met het beleid.
arXiv · · Miaobo Hu, Shuhao Hu, Xiaobo Guo +5 · cs.AI cs.CL cs.LG · Uit de samenvatting (arXiv, CC0)
Origineel: Large Language Continuous Diffusion Models
Despite the success of discrete diffusion language models (dLMs) for fast parallel decoding, their non-smooth, high-dimensional space hinders trajectory steering for reasoning and inference acceleration.
arXiv · · Zhihan Yang, Wei Guo, Jean-Marie Lemercier +14 · cs.CL cs.AI cs.LG · Uit de samenvatting (arXiv, CC0)
Origineel: Not Until the Evidence Says So: Teaching LLM Investigators When to Close a Case
Deze papieren studies wanneer LLM-onderzoekers een zaak moeten sluiten, waarbij gebruik wordt gemaakt van 731 gecontroleerde ongevallen-, defect- en uitvalgevallen; het rapporteert dat zelfs een grensmodel zijn bewijs in 91% van de antwoorden overschatte.
Origineel: Counterexample Generation via Per-Theorem Symbolic Verifiers: When Imitation Hurts and Reinforcement Repairs
Grote taalmodellen lossen vaak een stelling naar voren nog niet op om een nauw verwante valse te weerleggen: een vervalsingskloof die toezicht hield op fine-tuning sluit niet en kan actief verergeren.
Multi-party financiële chatrooms zijn van vitaal belang voor sales-and-trading professionals, maar hun complexiteit maakt handmatig herstel van gemiste trades onhaalbaar: elke Request for Quote (RFQ) is een gebeurtenis waarvan de uiteindelijke prijs en de handel resultaat verschijnen vele berichten na de...
arXiv · · Chin-Lun Fu, Hong Ni, Behrouz Madahian · cs.CL cs.AI · Uit de samenvatting (arXiv, CC0)
Origineel: APDMem: Agent-Controlled Progressive Disclosure for Query-Adaptive Long-Term Memory
APDMem organiseert een lange gespreksgeschiedenis in vier lagen, van thematische samenvattingen tot ruwe berichten, en boort alleen dieper wanneer een query het nodig heeft; op LongMemEval rapporteert het sterke resultaten tijdens het lezen van ongeveer 8% van de gesprekken.
arXiv · · Chin-Lun Fu, Anagha Kulkarni, Hong Ni +1 · cs.CL cs.AI · Samenvatting
Versterking leren van verifieerbare beloningen (RLVR) optimaliseert meestal antwoord correctheid, maar nuttig taal-model gedrag vereist ook hoogwaardige redeneren en beknopte reacties.
arXiv · · Doseok Jang, Jon Ander Campos, Youran Qi · cs.LG cs.AI cs.CL · Uit de samenvatting (arXiv, CC0)
Origineel: Are you Synthesizing or Recalling? Evaluating LLMs on Algorithmic Code Retrieval
Grote taalmodellen (LLM's) hebben sterke prestaties bij het genereren van codes aangetoond, waarbij succes afhangt van zowel het terugroepen van relevante algoritmische kennis als het redeneren over het toepassen ervan.
arXiv · · Nickil Maveli, Antonio Vergari, Shay B. Cohen · cs.LG cs.AI cs.CL cs.PL · Uit de samenvatting (arXiv, CC0)
Origineel: LEAP: Learning Efficient Action Proposals For LLM Agents
LEAP versnelt LLM-agenten door een klein ontwerpmodel te trainen op de eigen actiesequenties van het doelmodel, zodat de voorgestelde acties vaker overeenkomen, onder leiding van een latency-kader voor speculatieve actieronden.