Tägliche KI-Nachrichten aus offiziellen Quellen, Hacker News und arXiv
Titel und Zusammenfassungen auf dieser Seite sind offline maschinell aus dem Englischen übersetzt und können Fehler enthalten. Maßgeblich ist das verlinkte Original.
Die Werbung innerhalb von ChatGPT wächst weiter: OpenAI fügt ein visuelles Anzeigenformat sowie Tools zur Messung, Attribution und Markeneignung hinzu, was sowohl für Vermarkter als auch für alltägliche Nutzer von Bedeutung ist.
Ein konkreter Blick darauf, wie ein großes Labor plant, mit EU-Textnachweisregeln umzugehen, einschließlich der Frage, wo Wasserzeichen gelten und warum der Zugang zur Erkennung bei Forschern beginnt.
Ein seltenes Papier, das seine eigene Überschrift überprüft, behauptet: Die Autoren berichten, dass die Behebung ihrer Analysefehler die Kosteneinsparung um 23,9% auf 4,3% reduziert hat, eine nützliche Vorsicht für alle, die Agenten-Routing-Modelle bewerten.
arXiv
Hinweis der Redaktion: Die Zusammenfassungen wurden mit KI-Unterstützung aus dem Text der jeweiligen Herausgeber entworfen und warten noch auf eine menschliche Prüfung.
Von KI-Unternehmen und Forschungslaboren
Beiträge aus offiziellen Blogs von Unternehmen und Laboren der letzten 7 Tage.
Original: Our approach to EU text provenance rules
OpenAI beschreibt, wie es sich dem Text-Wasserzeichen nach EU-Vorschriften nähert: Wo Wasserzeichen gelten, wie die Erkennung funktioniert und warum der Zugang zur Erkennung bei Forschern beginnt.
Original: Building advertising for the way people use AI
OpenAI führte ein neues visuelles Anzeigenformat in ChatGPT ein und erweiterte Messtools, Attributionspartnerschaften und Markentauglichkeitskontrollen für Werbetreibende.
Original: Together Link: open models in the harness you already use. Start with one command today.
Together AI's Together Link bringt offene Modelle wie GLM 5.3 und Kimi K3 in Coding-Agenten-Teams, die bereits verwendet werden; Together sagt, dass es die Modellausgaben um mehr als 50% senken kann.
Together AI · · Zusammenfassung
Top-KI-Themen auf Hacker News
Beiträge mit KI-bezogenen Titeln, sortiert nach Punkten der letzten 36 Stunden.
Original: Fast Models, Slow Evidence: A Paired and Self-Audited Evaluation of System-1 Decision Models for LLM Agent Harnesses
Eine gepaarte Auswertung eines Open-Gewicht- und eines gehosteten Single-Pass-Entscheidungsmodells über 11 Agenten-Entscheidungspunkte ergab, dass das gehostete Modell an 9 von ihnen genauer war und weder die Chance auf das Zero-Shot-Modell-Routing schlug, noch die Autoren mehrere ihrer eigenen Analysefehler korrigierten.
Original: Right Order, Wrong Scale: Auditing LLM Judges for Occupational AI Measurement
Auditing 33 LLM-Richter-Konfigurationen gegen 45.796 Arbeitnehmer-Ratings, finden die Autoren Richter können Rang Antworten einigermaßen gut, aber schätzen Annahmequoten überall von 3,0% bis 97,9%, im Vergleich zu 61,1% für übereinstimmende Arbeitnehmer.
arXiv · · Harry Lyu, Neil Thompson · cs.AI cs.CL cs.CY cs.LG · Zusammenfassung
Original: ROUTEAUDIT: Interaction-Aware Identification for Budgeted Multi-Verifier Routing
Adaptive Multi-Verifier-Systeme werden üblicherweise durch Endpunkt-Qualitäts-Kosten-Lücken verglichen, selbst wenn sich der Verifier-Katalog, die Verfügbarkeit, die Buchhaltung, die Informationsfilterung oder der Scorer mit der Richtlinie ändern.
arXiv · · Miaobo Hu, Shuhao Hu, Xiaobo Guo +5 · cs.AI cs.CL cs.LG · Aus dem Abstract (arXiv, CC0)
Original: FSPO: Policy-Consistent Risk and Pareto-Feasible Control for Budgeted LLM RL Post-Training
Adaptives LLM-Verstärkungslernen nach dem Training ändert mehrere Trainingsaktoren online, einschließlich Rollout-Temperatur, Gruppengröße, Clipping, KL-Regulierung, Verifier-Zuweisung und Update-Budget.
arXiv · · Miaobo Hu, Shuhao Hu, Xiaobo Guo +4 · cs.AI cs.CL cs.LG · Aus dem Abstract (arXiv, CC0)
Original: Large Language Continuous Diffusion Models
Trotz des Erfolgs von diskreten Diffusionssprachmodellen (dLMs) für schnelle parallele Decodierung behindert ihr nicht glatter, hochdimensionaler Raum die Flugbahnlenkung für Schlussfolgerungen und Inferenzbeschleunigung.
arXiv · · Zhihan Yang, Wei Guo, Jean-Marie Lemercier +14 · cs.CL cs.AI cs.LG · Aus dem Abstract (arXiv, CC0)
Original: Not Until the Evidence Says So: Teaching LLM Investigators When to Close a Case
Dieses Papier untersucht, wenn LLM-Ermittler einen Fall schließen sollten, mit 731 geprüften Unfall-, Defekt- und Ausfallfällen; es berichtet, dass sogar ein Grenzmodell seine Beweise in 91% der Antworten überschätzt hat.
Original: Counterexample Generation via Per-Theorem Symbolic Verifiers: When Imitation Hurts and Reinforcement Repairs
Große Sprachmodelle lösen oft ein Theorem vorwärts, widerlegen jedoch nicht ein eng verwandtes falsches: Eine Fälschungslücke, die die Feinabstimmung überwacht, schließt sich nicht und kann sich aktiv verschlechtern.
Original: FinDialogLens: Event Extraction over Multi-Party Dialogue for Missed-Trade Identification in Financial Chatrooms
Multi-Party-Finanz-Chatrooms sind für Verkaufs- und Handelsprofis von entscheidender Bedeutung, aber ihre Komplexität macht die manuelle Wiederherstellung verpasster Trades undurchführbar: Jeder Request for Quote (RFQ) ist ein Ereignis, dessen endgültiger Preis und Handelsergebnis viele Nachrichten nach dem Ende des Jahres erscheinen.
arXiv · · Chin-Lun Fu, Hong Ni, Behrouz Madahian · cs.CL cs.AI · Aus dem Abstract (arXiv, CC0)
Original: APDMem: Agent-Controlled Progressive Disclosure for Query-Adaptive Long-Term Memory
APDMem organisiert eine lange Konversationsgeschichte in vier Schichten, von thematischen Zusammenfassungen bis hin zu rohen Nachrichten, und bohrt nur dann tiefer, wenn eine Abfrage sie benötigt; Auf LongMemEval werden starke Ergebnisse beim Lesen von etwa 8% der Gespräche gemeldet.
arXiv · · Chin-Lun Fu, Anagha Kulkarni, Hong Ni +1 · cs.CL cs.AI · Zusammenfassung
Verstärkungslernen aus verifizierbaren Belohnungen (RLVR) optimiert normalerweise die Richtigkeit der Antworten, aber nützliches Verhalten von Sprachmodellen erfordert auch qualitativ hochwertiges Denken und prägnante Antworten.
arXiv · · Doseok Jang, Jon Ander Campos, Youran Qi · cs.LG cs.AI cs.CL · Aus dem Abstract (arXiv, CC0)
Original: Are you Synthesizing or Recalling? Evaluating LLMs on Algorithmic Code Retrieval
Große Sprachmodelle (LLMs) haben eine starke Leistung bei der Codegenerierung gezeigt, bei der der Erfolg sowohl davon abhängt, dass relevantes algorithmisches Wissen abgerufen wird, als auch, wie man es anwendet.
arXiv · · Nickil Maveli, Antonio Vergari, Shay B. Cohen · cs.LG cs.AI cs.CL cs.PL · Aus dem Abstract (arXiv, CC0)
Original: LEAP: Learning Efficient Action Proposals For LLM Agents
LEAP beschleunigt LLM-Agenten, indem es ein kleines Drafter-Modell an den eigenen Aktionssequenzen des Zielmodells trainiert, so dass die vorgeschlagenen Aktionen häufiger übereinstimmen, geleitet von einem Latenz-Framework für spekulative Aktionsrunden.