Our approach to EU text provenance rules
OpenAI describes how it is approaching text watermarking under EU rules: where watermarks apply, how detection works, and why access to detection starts with researchers.
Ежедневные новости ИИ из официальных источников, Hacker News и arXiv
Заголовки и краткие описания на этой странице переведены с английского машинным переводом (офлайн) и могут содержать ошибки. Приоритет имеет оригинал по ссылке.
Реклама внутри ChatGPT продолжает расти: OpenAI добавляет визуальный формат рекламы плюс инструменты измерения, атрибуции и соответствия бренду, которые важны как для маркетологов, так и для обычных пользователей.
OpenAI
A concrete look at how one major lab plans to handle EU text-provenance rules, including where watermarks apply and why detection access starts with researchers.
OpenAI
Авторы сообщают, что исправление ошибок анализа сократило заявленную экономию на 23,9% до 4,3%, что является полезным предостережением для всех, кто оценивает модели маршрутизации агентов.
arXiv
Примечание редакции: Краткие описания подготовлены с помощью ИИ на основе текстов самих издателей и ещё не проверены человеком.
Записи из официальных блогов компаний и лабораторий за последние 7 дней.
OpenAI describes how it is approaching text watermarking under EU rules: where watermarks apply, how detection works, and why access to detection starts with researchers.
Оригинал: Building advertising for the way people use AI
OpenAI представила новый формат визуальной рекламы в ChatGPT и расширила инструменты измерения, партнерские отношения и контроль соответствия бренда для рекламодателей.
Оригинал: Together Link: open models in the harness you already use. Start with one command today.
Вместе AI's Together Link объединяет открытые модели, такие как GLM 5.3 и Kimi K3, в уже используемые команды кодирующих агентов; Together говорит, что может сократить расходы на модели более чем на 50%.
Публикации с заголовками об ИИ, отсортированные по баллам за последние 36 часов.
Оригинал: Anthropic reported diary entry to police, woman faces felony charge
Оригинал: OpenAI "rogue" agent activities found on Wikimedia projects
Оригинал: People are asking ChatGPT to help them decide how to vote in the midterms
Оригинал: Building a RAG pipeline for semantic code search
Автоматический отбор новых работ с приоритетом статей, одновременно размещённых в cs.AI, cs.CL и cs.LG. Это не рейтинг качества.
Парная оценка модели принятия решений с открытым весом и размещенной однопроходной моделью в 11 точках принятия решений агентами обнаружила, что размещенная модель более точна на 9 из них, не превышая шанса на маршрутизацию модели с нулевым выстрелом, и авторы исправили несколько собственных ошибок анализа.
Проверяя 33 конфигурации LLM-судей по сравнению с 45 796 рейтингами работников, авторы считают, что судьи могут ранжировать ответы достаточно хорошо, но оценивать коэффициенты принятия от 3,0% до 97,9% по сравнению с 61,1% для соответствующих работников.
Оригинал: ROUTEAUDIT: Interaction-Aware Identification for Budgeted Multi-Verifier Routing
Адаптивные системы с несколькими верификаторами обычно сравниваются через пробелы в стоимости качества конечных точек, даже когда каталог верификатора, доступность, учет, фильтрация информации или счетчик изменяются вместе с политикой.
Оригинал: FSPO: Policy-Consistent Risk and Pareto-Feasible Control for Budgeted LLM RL Post-Training
Адаптивное LLM-обучение с подкреплением после обучения меняет несколько исполнительных механизмов обучения в Интернете, включая температуру развертывания, размер группы, обрезку, регуляризацию KL, распределение верификатора и бюджет обновления.
Оригинал: Verifiable, Articulable, and Tacit Components of Preference
Что делает короткую историю захватывающей; новостную статью достойной новостей; или математическое доказательство элегантным?
Оригинал: Large Language Continuous Diffusion Models
Despite the success of discrete diffusion language models (dLMs) for fast parallel decoding, their non-smooth, high-dimensional space hinders trajectory steering for reasoning and inference acceleration.
Оригинал: Not Until the Evidence Says So: Teaching LLM Investigators When to Close a Case
В этой статье исследуется, когда следователи LLM должны закрыть дело, используя 731 проверенный случай несчастного случая, дефекта и сбоя; он сообщает, что даже пограничная модель завысила свои доказательства в 91% ответов.
Оригинал: Counterexample Generation via Per-Theorem Symbolic Verifiers: When Imitation Hurts and Reinforcement Repairs
Большие языковые модели часто решают теорему вперед, но не могут опровергнуть тесно связанную ложную: пробел в фальсификации, который контролировал тонкую настройку, не закрывается и может активно ухудшаться.
Оригинал: FinDialogLens: Event Extraction over Multi-Party Dialogue for Missed-Trade Identification in Financial Chatrooms
Многопартийные финансовые чаты жизненно важны для профессионалов в области продаж и торговли, но их сложность делает ручное восстановление пропущенных сделок неосуществимым: каждый запрос на цитату (RFQ) - это событие, конечная цена и результаты торговли которого появляются после многих сообщений.
Оригинал: APDMem: Agent-Controlled Progressive Disclosure for Query-Adaptive Long-Term Memory
APDMem организует долгую историю разговоров на четыре уровня, от тематических резюме до необработанных сообщений, и углубляется только тогда, когда запрос нуждается в нем; на LongMemEval он сообщает о сильных результатах, читая около 8% разговоров.
Оригинал: Lexicographic Multi-Objective On-Policy Distillation
Усиление обучения с помощью поддающихся проверке вознаграждений (RLVR) обычно оптимизирует правильность ответа, но полезное поведение языковой модели также требует высококачественных рассуждений и кратких ответов.
Оригинал: Are you Synthesizing or Recalling? Evaluating LLMs on Algorithmic Code Retrieval
Большие языковые модели (LLM) продемонстрировали высокую производительность в генерации кода, где успех зависит как от отзыва соответствующих алгоритмических знаний, так и от рассуждений о том, как их применять.
Оригинал: How Causality Bridges the Semantic Gap
Численные измерения фиксируют поведение системы, но часто оставляют значения ее переменных неопределенными.
Оригинал: LEAP: Learning Efficient Action Proposals For LLM Agents
LEAP ускоряет агентов LLM, обучая небольшую модель составителя на собственных последовательностях действий целевой модели, поэтому предлагаемые действия чаще совпадают, руководствуясь рамками задержки для раундов спекулятивных действий.
Оригинал: OPD Before RL: Warm-Starting Rubric-Based RL with On-Policy Distillation
Многие полезные задачи языковой модели не могут быть оценены с помощью точной проверки результатов.
Не включены:
Обновлено: 2026-10-05 20:08 UTC