Our approach to EU text provenance rules
OpenAI describes how it is approaching text watermarking under EU rules: where watermarks apply, how detection works, and why access to detection starts with researchers.
Codzienne wiadomości o AI z oficjalnych źródeł, Hacker News i arXiv
Tytuły i podsumowania na tej stronie zostały przetłumaczone maszynowo z angielskiego (offline) i mogą zawierać błędy. Rozstrzyga podlinkowany oryginał.
Reklama wewnątrz ChatGPT stale rośnie: OpenAI dodaje wizualny format reklamowy oraz narzędzia pomiarowe, przypisywanie i dopasowywanie marki, które mają znaczenie zarówno dla marketerów, jak i dla użytkowników codziennych.
OpenAI
A concrete look at how one major lab plans to handle EU text-provenance rules, including where watermarks apply and why detection access starts with researchers.
OpenAI
Rzadki dokument, który kontroluje swoje własne główne twierdzenia: autorzy donosi, że ustalenie ich błędów w analizie zmniejszyło deklarowane oszczędności kosztów o 23,9% do 4,3%, co jest użyteczną ostrożnością dla każdego oceniającego modele routingu agentów.
arXiv
Uwaga redakcji: Podsumowania przygotowano z pomocą AI na podstawie tekstu każdego wydawcy i czekają na weryfikację przez człowieka.
Wpisy z oficjalnych blogów firm i laboratoriów opublikowane w ciągu ostatnich 7 dni.
OpenAI describes how it is approaching text watermarking under EU rules: where watermarks apply, how detection works, and why access to detection starts with researchers.
Oryginał: Building advertising for the way people use AI
OpenAI wprowadziła nowy wizualny format reklamowy w ChatGPT i rozszerzone narzędzia pomiarowe, przypisywanie partnerstw i kontroli adekwatności marki reklamodawcom.
Oryginał: Together Link: open models in the harness you already use. Start with one command today.
Razem AI 's Together Link wprowadza otwarte modele, takie jak GLM 5.3 i Kimi K3 do już używanych zespołów kodujących; razem mówi, że może zmniejszyć wydatki modelu o ponad 50%.
Wpisy z tytułami związanymi z AI, uszeregowane według punktów z ostatnich 36 godzin.
Oryginał: Anthropic reported diary entry to police, woman faces felony charge
Oryginał: OpenAI "rogue" agent activities found on Wikimedia projects
Oryginał: How to scale intent, quality, and artistry with AI [video]
Oryginał: Homa: The end of TCP for AI clusters [video]
Oryginał: Spending on AI Is Becoming Almost Impossible for Businesses to Budget
Oryginał: Accept 'bad things' in return for benefits of AI, says Sam Altman
Oryginał: Florida woman arrested for allegedly making threats in an AI chat
Oryginał: People are asking ChatGPT to help them decide how to vote in the midterms
Oryginał: Building a RAG pipeline for semantic code search
Oryginał: Altman: The world should accept some bad things happening for the benefits of AI
Automatyczny wybór nowych zgłoszeń, z preferencją dla prac jednocześnie w cs.AI, cs.CL i cs.LG. To nie jest ranking jakości.
Oryginał: Fast Models, Slow Evidence: A Paired and Self-Audited Evaluation of System-1 Decision Models for LLM Agent Harnesses
Para ocena otwartej wagi i hostingowego modelu decyzji single-pass w 11 punktów decyzji agenta znalazła model hostingowy bardziej dokładne na 9 z nich, ani nie pokonując szans na zero-shot modelu routingu, a autorzy poprawiając kilka własnych błędów analizy.
Oryginał: Right Order, Wrong Scale: Auditing LLM Judges for Occupational AI Measurement
Kontrolując 33 konfiguracje LLM- jury wobec 45,796 ocen pracowników, autorzy znaleźć sędziowie mogą rangi odpowiedzi dość dobrze, ale oszacować wskaźnik akceptacji w dowolnym miejscu od 3,0% do 97,9%, w porównaniu do 61,1% dla dopasowanych pracowników.
Oryginał: ROUTEAUDIT: Interaction-Aware Identification for Budgeted Multi-Verifier Routing
Adaptacyjne systemy wielu weryfikatorów są często porównywane przez luki w kosztach jakości punktów końcowych, nawet jeśli katalog weryfikatorów, dostępność, rachunkowość, filtrowanie informacji lub wynik zmian w polityce.
Oryginał: FSPO: Policy-Consistent Risk and Pareto-Feasible Control for Budgeted LLM RL Post-Training
Adaptive LLM provident- learning post-training zmienia wiele siłowników treningowych online, w tym temperatura toczenia, wielkość grupy, wycinki, Regulacja KL, alokacja weryfikatorów, i uaktualnić budżet.
Oryginał: Verifiable, Articulable, and Tacit Components of Preference
Co sprawia, że krótka historia chwyta; wiadomości wiadomości godne newsworthy, czy dowód matematyczny elegancki?
Oryginał: Large Language Continuous Diffusion Models
Pomimo sukcesu dyskretnych modeli językowych rozprzestrzeniania (dLMs) dla szybkiego dekodowania równoległego, ich niepłodne, wysokim wymiarem przestrzeń uniemożliwia kierowanie ścieżką do rozumienia i przyspieszenia inferencji.
Oryginał: Not Until the Evidence Says So: Teaching LLM Investigators When to Close a Case
Ten dokument bada, kiedy śledczy LLM powinni zamknąć sprawę, wykorzystując 731 skontrolowanych wypadków, defektów i przypadków niewykonania zobowiązania; informuje, że nawet model graniczny zawyżał swoje dowody w 91% odpowiedzi.
Oryginał: Counterexample Generation via Per-Theorem Symbolic Verifiers: When Imitation Hurts and Reinforcement Repairs
Duże modele językowe często rozwiązują twierdzenia do przodu, ale nie obalić blisko spokrewnione fałszywe: luki fałszerstwa, które nadzorowane finetuning nie zamyka i może aktywnie pogarszać.
Oryginał: FinDialogLens: Event Extraction over Multi-Party Dialogue for Missed-Trade Identification in Financial Chatrooms
Wielopartyjne rozmowy finansowe są niezbędne dla sprzedawców i handlowców, ale ich złożoność sprawia, że ręczne odzyskanie pominiętych transakcji jest niewykonalne: każdy wniosek o kwotowanie (RFQ) jest wydarzeniem, którego ostateczna cena i wynik handlu pojawiają się wiele wiadomości po
Oryginał: APDMem: Agent-Controlled Progressive Disclosure for Query-Adaptive Long-Term Memory
APDMEM organizuje długą historię konwersacji na cztery warstwy, od podsumowań tematycznych aż do surowych wiadomości, i wierci głębiej tylko wtedy, gdy zapytanie jej potrzebuje; na LongMemEval podaje silne wyniki podczas czytania około 8% rozmów.
Oryginał: Lexicographic Multi-Objective On-Policy Distillation
Wzmocnienie uczenia się od weryfikowalnych nagród (RLVR) zazwyczaj optymalizuje poprawność odpowiedzi, ale przydatne zachowanie modelu językowego wymaga również wysokiej jakości rozumowania i zwięzłe odpowiedzi.
Oryginał: Are you Synthesizing or Recalling? Evaluating LLMs on Algorithmic Code Retrieval
Duże modele językowe (LLM) wykazały się wysoką wydajnością w generowaniu kodów, gdzie sukces zależy zarówno od przypomnienia odpowiedniej wiedzy algorytmicznej, jak i od tego, jak ją zastosować.
Oryginał: How Causality Bridges the Semantic Gap
Numeryczne pomiary rejestrują zachowanie systemu, ale często pozostawiają nieokreślone znaczenie jego zmiennych.
Oryginał: LEAP: Learning Efficient Action Proposals For LLM Agents
LEAP przyspiesza działania agentów LLM poprzez szkolenie małego modelu draftera na własnych sekwencjach działania modelu docelowego, tak więc proponowane działania częściej się pokrywają, kierując się opóźnieniami w spekulacyjnych rundach działania.
Oryginał: OPD Before RL: Warm-Starting Rubric-Based RL with On-Policy Distillation
Wiele użytecznych zadań modelu językowego nie może być ocenionych za pomocą dokładnej weryfikacji wyników.
Nieuwzględnione:
Zaktualizowano: 2026-10-05 20:08 UTC