Our approach to EU text provenance rules
OpenAI descrive come si sta avvicinando il testo watermarking secondo le regole UE: dove si applicano i filigrani, come funziona il rilevamento e perché l'accesso al rilevamento inizia con i ricercatori.
Notizie quotidiane sull'IA da fonti ufficiali, Hacker News e arXiv
Titoli e sintesi in questa pagina sono tradotti automaticamente dall'inglese (offline) e possono contenere errori. Fa fede l'originale collegato.
La pubblicità all'interno di ChatGPT continua a crescere: OpenAI sta aggiungendo un formato di pubblicità visiva più strumenti di misura, attribuzione e idoneità del marchio, che conta sia per i marketers che per gli utenti di tutti i giorni.
OpenAI
Uno sguardo concreto su come un grande laboratorio prevede di gestire le regole di prova del testo dell'UE, tra cui dove si applicano le filigrane e perché l'accesso al rilevamento inizia con i ricercatori.
OpenAI
Una carta rara che controlla le proprie affermazioni di titolo: gli autori segnalano che fissare i loro errori di analisi hanno ridotto un risparmio di costi del 23,9% al 4,3%, una utile cautela per chiunque valuti i modelli di aggiornamento dell'agente.
arXiv
Nota della redazione: Le sintesi sono state redatte con l'aiuto dell'IA a partire dal testo di ciascun editore e sono in attesa di revisione umana.
Post dai blog ufficiali di aziende e laboratori pubblicati negli ultimi 7 giorni.
OpenAI descrive come si sta avvicinando il testo watermarking secondo le regole UE: dove si applicano i filigrani, come funziona il rilevamento e perché l'accesso al rilevamento inizia con i ricercatori.
Originale: Building advertising for the way people use AI
OpenAI ha introdotto un nuovo formato di annunci visivi in ChatGPT e strumenti di misura ampliati, partenariati di attribuzione e controlli di idoneità del marchio per gli inserzionisti.
Originale: Together Link: open models in the harness you already use. Start with one command today.
Insieme di AI's Together Link porta modelli aperti come GLM 5.3 e Kimi K3 in agenti di codifica che già utilizzano i team; Insieme dice che può tagliare il modello spendere di oltre il 50%.
Storie con titoli legati all'IA, ordinate per punti nelle ultime 36 ore.
Originale: Anthropic reported diary entry to police, woman faces felony charge
Originale: OpenAI "rogue" agent activities found on Wikimedia projects
Originale: How to scale intent, quality, and artistry with AI [video]
Originale: Homa: The end of TCP for AI clusters [video]
Originale: Spending on AI Is Becoming Almost Impossible for Businesses to Budget
Originale: Accept 'bad things' in return for benefits of AI, says Sam Altman
Originale: Florida woman arrested for allegedly making threats in an AI chat
Originale: People are asking ChatGPT to help them decide how to vote in the midterms
Originale: Building a RAG pipeline for semantic code search
Originale: Altman: The world should accept some bad things happening for the benefits of AI
Selezione automatica dei nuovi invii, privilegiando gli articoli elencati insieme in cs.AI, cs.CL e cs.LG. Non è una classifica di qualità.
Originale: Fast Models, Slow Evidence: A Paired and Self-Audited Evaluation of System-1 Decision Models for LLM Agent Harnesses
Una valutazione accoppiata di un open-weight e un modello di decisione single-pass ospitato in 11 punti di decisione agente ha trovato il modello ospitato più accurato su 9 di loro, né battere possibilità su routing modello zero-shot, e gli autori correggere alcuni dei loro errori di analisi.
Originale: Right Order, Wrong Scale: Auditing LLM Judges for Occupational AI Measurement
Auditing 33 LLM-judge configurazioni contro 45.796 valutazioni dei lavoratori, gli autori trovano che i giudici possono classificare le risposte ragionevolmente bene ma stimano i tassi di accettazione ovunque dal 3,0% al 97,9%, contro il 61,1% per i lavoratori abbinati.
Originale: ROUTEAUDIT: Interaction-Aware Identification for Budgeted Multi-Verifier Routing
I sistemi multi-verifier adattivi sono comunemente confrontati attraverso lacune di qualità-costo endpoint, anche quando il catalogo di verifica, la disponibilità, la contabilità, la filtrazione delle informazioni o i cambiamenti del segnapunti con la politica.
Originale: FSPO: Policy-Consistent Risk and Pareto-Feasible Control for Budgeted LLM RL Post-Training
Adaptive LLM rinforzi-learning post-training cambia più attuatori di formazione on-line, tra cui temperatura di rollout, dimensione del gruppo, clipping, regolarizzazione KL, allocazione di verifica e budget di aggiornamento.
Originale: Verifiable, Articulable, and Tacit Components of Preference
Che cosa rende una breve storia presa; un articolo di notizie degno di nota; o una prova di matematica elegante?
Originale: Large Language Continuous Diffusion Models
Nonostante il successo di discreti modelli di linguaggio di diffusione (dLMs) per decodifica rapida parallela, il loro spazio non fuotico, ad alta dimensione ostacola lo sterzo traiettorio per ragionamento e accelerazione dell'inferenza.
Originale: Not Until the Evidence Says So: Teaching LLM Investigators When to Close a Case
Questo documento studia quando gli investigatori LLM dovrebbero chiudere un caso, utilizzando 731 casi di incidente, difetti e di evasione verificati; riporta che anche un modello di frontiera ha superato le sue prove nel 91% delle risposte.
Originale: Counterexample Generation via Per-Theorem Symbolic Verifiers: When Imitation Hurts and Reinforcement Repairs
I grandi modelli di lingua spesso risolvono un teorema in avanti ma non riescono a smentire un falso strettamente correlato: un gap di falsificazione che supervisionava la fine-tuning non si chiude e può peggiorare attivamente.
Originale: FinDialogLens: Event Extraction over Multi-Party Dialogue for Missed-Trade Identification in Financial Chatrooms
Le chat finanziarie multi-partite sono vitali per i professionisti delle vendite-e-trading, ma la loro complessità rende infesibile il recupero manuale dei mestieri mancati: ogni richiesta di preventivo (RFQ) è un evento il cui prezzo finale e il risultato commerciale appaiono molti messaggi dopo il...
Originale: APDMem: Agent-Controlled Progressive Disclosure for Query-Adaptive Long-Term Memory
APDMem organizza una lunga storia di conversazione in quattro strati, dai riassunti tematici fino ai messaggi grezzi, e esercita più a fondo solo quando una query ne ha bisogno; su LongMemEval riporta risultati forti mentre legge circa l'8% delle conversazioni.
Originale: Lexicographic Multi-Objective On-Policy Distillation
L'apprendimento di rinforzo da ricompense verificabili (RLVR) di solito ottimizza la correttezza della risposta, ma il comportamento linguistico utile-modello richiede anche risposte ragionanti e concise di alta qualità.
Originale: Are you Synthesizing or Recalling? Evaluating LLMs on Algorithmic Code Retrieval
Modelli linguistici di grandi dimensioni (LLM) hanno dimostrato forti prestazioni nella generazione di codici, dove il successo dipende sia dal richiamo di conoscenze algoritmiche rilevanti e dal ragionamento su come applicarlo.
Originale: How Causality Bridges the Semantic Gap
Le misurazioni numeriche catturano come si comporta un sistema, ma spesso lasciano i significati delle sue variabili non specificate.
Originale: LEAP: Learning Efficient Action Proposals For LLM Agents
LEAP velocizza gli agenti LLM formando un piccolo modello di bozza sulle sequenze d'azione proprie del modello di destinazione in modo che le sue azioni proposte corrispondano più spesso, guidato da un quadro di latenza per i turni di azione speculativi.
Originale: OPD Before RL: Warm-Starting Rubric-Based RL with On-Policy Distillation
Molti utili compiti linguistici-modello non possono essere valutati con la verifica esatta dei risultati.
Non incluse:
Aggiornato: 2026-10-05 20:08 UTC