Our approach to EU text provenance rules
OpenAI describes how it is approaching text watermarking under EU rules: where watermarks apply, how detection works, and why access to detection starts with researchers.
Notícias diárias de IA de fontes oficiais, Hacker News e arXiv
Os títulos e resumos desta página são traduções automáticas do inglês (offline) e podem conter erros. Prevalece o original vinculado.
Publicidade dentro do ChatGPT continua crescendo: OpenAI está adicionando um formato de anúncio visual mais ferramentas de medição, atribuição e adequação da marca, que importa tanto para profissionais de marketing quanto para usuários do dia a dia.
OpenAI
A concrete look at how one major lab plans to handle EU text-provenance rules, including where watermarks apply and why detection access starts with researchers.
OpenAI
Um artigo raro que audita suas próprias alegações de manchete: os autores relatam que a correção de seus erros de análise reduziu uma economia de custos de 23,9% para 4,3%, uma cautela útil para quem avalia modelos de roteamento de agentes.
arXiv
Nota do editor: Os resumos foram redigidos com ajuda de IA a partir do texto de cada editor original e aguardam revisão humana.
Posts de blogs oficiais de empresas e laboratórios publicados nos últimos 7 dias.
OpenAI describes how it is approaching text watermarking under EU rules: where watermarks apply, how detection works, and why access to detection starts with researchers.
Original: Building advertising for the way people use AI
O OpenAI introduziu um novo formato de anúncio visual no ChatGPT e expandiu ferramentas de medição, parcerias de atribuição e controles de adequação de marca para anunciantes.
Original: Together Link: open models in the harness you already use. Start with one command today.
Juntas AI's Together Link traz modelos abertos como GLM 5.3 e Kimi K3 para as equipes de agentes de codificação que já usam; Juntos diz que pode reduzir o gasto do modelo em mais de 50%.
Histórias com títulos relacionados a IA, ordenadas por pontos nas últimas 36 horas.
Original: Anthropic reported diary entry to police, woman faces felony charge
Original: OpenAI "rogue" agent activities found on Wikimedia projects
Original: How to scale intent, quality, and artistry with AI [video]
Original: Spending on AI Is Becoming Almost Impossible for Businesses to Budget
Original: Accept 'bad things' in return for benefits of AI, says Sam Altman
Original: Florida woman arrested for allegedly making threats in an AI chat
Original: People are asking ChatGPT to help them decide how to vote in the midterms
Original: Building a RAG pipeline for semantic code search
Original: Altman: The world should accept some bad things happening for the benefits of AI
Seleção automática de novas submissões, priorizando artigos listados ao mesmo tempo em cs.AI, cs.CL e cs.LG. Não é um ranking de qualidade.
Uma avaliação emparelhada de um modelo de decisão em um único passo e em um único passo, em 11 pontos de decisão de agentes, encontrou o modelo hospedado mais preciso em 9 deles, nem a chance de bater no roteamento do modelo de tiro zero, e os autores corrigiram vários de seus próprios erros de análise.
Original: Right Order, Wrong Scale: Auditing LLM Judges for Occupational AI Measurement
Auditando 33 configurações de juízes de LLM contra 45.796 classificações de trabalhadores, os autores encontram juízes que podem classificar as respostas razoavelmente bem, mas ainda assim estimar taxas de aceitação em qualquer lugar de 3,0% a 97,9%, versus 61,1% para trabalhadores pareados.
Original: ROUTEAUDIT: Interaction-Aware Identification for Budgeted Multi-Verifier Routing
Sistemas multi-verificadores adaptativos são comumente comparados através de gaps de custo-qualidade de endpoint, mesmo quando o catálogo do verificador, disponibilidade, contabilidade, filtragem de informações, ou escore muda com a política.
Original: FSPO: Policy-Consistent Risk and Pareto-Feasible Control for Budgeted LLM RL Post-Training
Adaptive LLM reforço-aprendizagem pós-treinamento muda vários atuadores de treinamento on-line, incluindo temperatura de implantação, tamanho do grupo, recorte, regularização KL, alocação de verificador e orçamento de atualização.
Original: Verifiable, Articulable, and Tacit Components of Preference
O que torna um conto emocionante; um artigo jornalístico digno de notícias; ou uma prova de matemática elegante?
Original: Large Language Continuous Diffusion Models
Apesar do sucesso de modelos discretos de linguagem de difusão (dLMs) para rápida decodificação paralela, seu espaço não suave e de alta dimensão dificulta o direcionamento da trajetória para o raciocínio e aceleração de inferência.
Original: Not Until the Evidence Says So: Teaching LLM Investigators When to Close a Case
Este artigo estuda quando os investigadores de LLM devem encerrar um caso, utilizando 731 casos de acidentes, defeitos e interrupções auditados; relata que mesmo um modelo de fronteira superou suas evidências em 91% das respostas.
Original: Counterexample Generation via Per-Theorem Symbolic Verifiers: When Imitation Hurts and Reinforcement Repairs
Modelos de linguagem grandes muitas vezes resolvem um teorema para frente, mas não conseguem refutar um falso intimamente relacionado: uma falha de falsificação que supervisionou o ajuste fino não fecha e pode ativamente piorar.
Original: FinDialogLens: Event Extraction over Multi-Party Dialogue for Missed-Trade Identification in Financial Chatrooms
Salas de bate-papo financeiras multipartidárias são vitais para profissionais de vendas e negociação, mas sua complexidade torna inviável a recuperação manual de transações perdidas: cada Pedido de Citação (RFQ) é um evento cujo preço final e resultado comercial aparecem muitas mensagens após o...
Original: APDMem: Agent-Controlled Progressive Disclosure for Query-Adaptive Long-Term Memory
APDMem organiza uma longa história de conversação em quatro camadas, desde resumos temáticos até mensagens cruas, e perfura mais fundo apenas quando uma consulta precisa dela; em LongMemEval relata resultados fortes ao ler cerca de 8% das conversas.
Original: Lexicographic Multi-Objective On-Policy Distillation
A aprendizagem de reforço de recompensas verificáveis (RLVR) geralmente otimiza a correção de respostas, mas o comportamento útil do modelo de linguagem também requer raciocínio de alta qualidade e respostas concisas.
Original: Are you Synthesizing or Recalling? Evaluating LLMs on Algorithmic Code Retrieval
Modelos de linguagem grandes (LLMs) têm demonstrado forte desempenho na geração de código, onde o sucesso depende tanto de lembrar conhecimento algoritmo relevante e raciocínio sobre como aplicá-lo.
Original: How Causality Bridges the Semantic Gap
Medições numéricas captam como um sistema se comporta, mas muitas vezes deixam os significados de suas variáveis não especificadas.
Original: LEAP: Learning Efficient Action Proposals For LLM Agents
LEAP acelera os agentes LLM através do treinamento de um pequeno modelo de rascunho nas sequências de ação do próprio modelo-alvo para que suas ações propostas correspondam mais frequentemente, guiadas por um framework de latência para rodadas de ação especulativas.
Original: OPD Before RL: Warm-Starting Rubric-Based RL with On-Policy Distillation
Muitas tarefas úteis do modelo de linguagem não podem ser avaliadas pela verificação exata do resultado.
Não incluídas:
Atualizado: 2026-10-05 20:08 UTC