Our approach to EU text provenance rules
OpenAI describes how it is approaching text watermarking under EU rules: where watermarks apply, how detection works, and why access to detection starts with researchers.
Noticias diarias de IA de fuentes oficiales, Hacker News y arXiv
Los títulos y resúmenes de esta página son traducciones automáticas del inglés (sin conexión) y pueden contener errores. Prevalece el original enlazado.
La publicidad dentro de ChatGPT sigue creciendo: OpenAI está añadiendo un formato de anuncio visual más las herramientas de medición, atribución y compatibilidad de marca, que importa tanto para los marketers como para los usuarios cotidianos.
OpenAI
A concrete look at how one major lab plans to handle EU text-provenance rules, including where watermarks apply and why detection access starts with researchers.
OpenAI
Un papel raro que audita sus propias afirmaciones de titularidad: los autores informan que la fijación de sus errores de análisis cortó un 23,9% de ahorro de costes a 4,3%, una precaución útil para cualquiera que evalúe los modelos de manejo de agentes.
arXiv
Nota del editor: Los resúmenes se redactaron con ayuda de IA a partir del texto de cada editor original y están pendientes de revisión humana.
Publicaciones de blogs oficiales de empresas y laboratorios de los últimos 7 días.
OpenAI describes how it is approaching text watermarking under EU rules: where watermarks apply, how detection works, and why access to detection starts with researchers.
Original: Building advertising for the way people use AI
OpenAI introdujo un nuevo formato de anuncio visual en ChatGPT y herramientas de medición ampliadas, asociaciones de atribución y controles de compatibilidad de marca para los anunciantes.
Original: Together Link: open models in the harness you already use. Start with one command today.
Juntos AI's Together Link trae modelos abiertos como GLM 5.3 y Kimi K3 en agentes de codificación que ya utilizan equipos; Together dice que puede reducir el gasto de modelo en más del 50%.
Historias con títulos relacionados con la IA, ordenadas por puntos en las últimas 36 horas.
Original: Anthropic reported diary entry to police, woman faces felony charge
Original: OpenAI "rogue" agent activities found on Wikimedia projects
Original: How to scale intent, quality, and artistry with AI [video]
Original: Spending on AI Is Becoming Almost Impossible for Businesses to Budget
Original: Accept 'bad things' in return for benefits of AI, says Sam Altman
Original: People are asking ChatGPT to help them decide how to vote in the midterms
Original: Building a RAG pipeline for semantic code search
Original: Altman: The world should accept some bad things happening for the benefits of AI
Selección automática de envíos nuevos, priorizando artículos listados a la vez en cs.AI, cs.CL y cs.LG. No es una clasificación de calidad.
Una evaluación emparejada de un modelo de decisión de un solo paso abierto y hospedado en 11 puntos de decisión del agente encontró el modelo hospedado más exacto en 9 de ellos, ni la oportunidad de golpear en la ruta del modelo de cero instantánea, y los autores corrigiendo varios de sus propios errores de análisis.
Auditoría de 33 configuraciones de jueces de LLM contra 45.796 calificaciones de los trabajadores, los autores encuentran que los jueces pueden clasificar las respuestas razonablemente bien pero estiman las tasas de aceptación en cualquier lugar del 3,0% al 97,9%, frente al 61,1% para los trabajadores emparejados.
Original: ROUTEAUDIT: Interaction-Aware Identification for Budgeted Multi-Verifier Routing
Los sistemas multiverificadores adaptativos se comparan comúnmente a través de lagunas de costos de calidad de punta final, incluso cuando el catálogo verificador, disponibilidad, contabilidad, filtración de información o marcador cambia con la política.
Original: FSPO: Policy-Consistent Risk and Pareto-Feasible Control for Budgeted LLM RL Post-Training
Adaptive LLM reinforcement-learning post-training changes multiple training actuators online, including rollout temperature, group size, clipping, KL regularization, verifier allocation, and update budget.
Original: Verifiable, Articulable, and Tacit Components of Preference
¿Qué hace que una historia corta agarre; un artículo de noticias digno de mención; o una prueba de matemáticas elegante?
Original: Large Language Continuous Diffusion Models
A pesar del éxito de los modelos discretos de lenguaje de difusión (dLMs) para la rápida decodificación paralela, su espacio no silencioso y de alta dimensión dificulta la dirección de la trayectoria para la aceleración del razonamiento y la inferencia.
Original: Not Until the Evidence Says So: Teaching LLM Investigators When to Close a Case
Este documento estudia cuando los investigadores de LLM deberían cerrar un caso, utilizando 731 casos de accidente auditado, defectos y casos de desfavorables; informa que incluso un modelo fronterizo superó sus pruebas en el 91% de las respuestas.
Original: Counterexample Generation via Per-Theorem Symbolic Verifiers: When Imitation Hurts and Reinforcement Repairs
Los grandes modelos de lenguaje a menudo resuelven un teorema hacia adelante pero no refutan un falso estrechamente relacionado: una brecha de falsificación que supervisa el ajuste fino no cierra y puede empeorar activamente.
Original: FinDialogLens: Event Extraction over Multi-Party Dialogue for Missed-Trade Identification in Financial Chatrooms
Los chats financieros multipartidistas son vitales para los profesionales de ventas y ventas, pero su complejidad hace que la recuperación manual de los comercios perdidos infeasible: cada solicitud de cotización (RFQ) es un evento cuyo precio final y resultado comercial parecen muchos mensajes después de la...
Original: APDMem: Agent-Controlled Progressive Disclosure for Query-Adaptive Long-Term Memory
APDMem organiza una larga historia de conversación en cuatro capas, desde resúmenes temáticos hasta mensajes crudos, y perfora más profundamente sólo cuando una consulta lo necesita; en LongMemEval reporta resultados fuertes mientras lee alrededor del 8% de las conversaciones.
Original: Lexicographic Multi-Objective On-Policy Distillation
El aprendizaje de refuerzo a partir de recompensas verificables (RLVR) generalmente optimiza la corrección de respuesta, pero el comportamiento útil del modelo de lenguaje también requiere un razonamiento de alta calidad y respuestas concisas.
Original: Are you Synthesizing or Recalling? Evaluating LLMs on Algorithmic Code Retrieval
Los grandes modelos de lenguaje (LLMs) han demostrado un fuerte rendimiento en la generación de códigos, donde el éxito depende tanto de recordar el conocimiento algoritmo relevante y el razonamiento sobre cómo aplicarlo.
Original: How Causality Bridges the Semantic Gap
Las mediciones numéricas captan cómo se comporta un sistema, pero a menudo dejan sin especificar los significados de sus variables.
Original: LEAP: Learning Efficient Action Proposals For LLM Agents
LEAP acelera los agentes de LLM adiestrando un pequeño modelo de borrador en las propias secuencias de acción del modelo objetivo para que sus acciones propuestas coincidan más a menudo, guiado por un marco de latencia para rondas de acción especulativas.
Muchas tareas útiles del modelo de lenguaje no pueden evaluarse mediante la verificación exacta de resultados.
No incluidas:
Actualizado: 2026-10-05 20:08 UTC