Our approach to EU text provenance rules
OpenAI describes how it is approaching text watermarking under EU rules: where watermarks apply, how detection works, and why access to detection starts with researchers.
每日彙整官方發布、Hacker News 與 arXiv 的 AI 新聞
本頁標題與摘要由英文離線機器翻譯,可能有誤。請以連結的原文為準。
A concrete look at how one major lab plans to handle EU text-provenance rules, including where watermarks apply and why detection access starts with researchers.
OpenAI
一份審計自己頭條索賠的罕見檔案:作者報告說,糾正分析錯誤將索賠的23.9%的費用節省降至4.3%,這對任何評估代理路線模型的人來說都是有用的警告。
arXiv
編輯附註: 摘要是根據各發布者的原文、在 AI 協助下撰寫的草稿,尚待人工審閱。
過去 7 天內發布於公司與研究機構官方部落格的文章。
OpenAI describes how it is approaching text watermarking under EU rules: where watermarks apply, how detection works, and why access to detection starts with researchers.
原文: Building advertising for the way people use AI
OpenAI在ChatGPT中引入了新的視覺廣告格式,並擴充套件了計量工具,歸屬夥伴關係和廣告商的品牌適用性控制。
原文: Together Link: open models in the harness you already use. Start with one command today.
共同AI的「共同連結」將GLM 5.3和Kimi K3等開放模型帶入已經使用的編碼代理團隊;共同表示可以將模型開支削減50%以上。
過去 36 小時內標題與 AI 相關的文章,依分數排序。
原文: Anthropic reported diary entry to police, woman faces felony charge
原文: OpenAI "rogue" agent activities found on Wikimedia projects
原文: How to scale intent, quality, and artistry with AI [video]
原文: Homa: The end of TCP for AI clusters [video]
原文: Spending on AI Is Becoming Almost Impossible for Businesses to Budget
原文: Accept 'bad things' in return for benefits of AI, says Sam Altman
原文: Florida woman arrested for allegedly making threats in an AI chat
原文: People are asking ChatGPT to help them decide how to vote in the midterms
原文: Building a RAG pipeline for semantic code search
原文: Altman: The world should accept some bad things happening for the benefits of AI
自動挑選新投稿(優先選擇同時列於 cs.AI、cs.CL、cs.LG 的論文),並非品質排名。
對11個代理決定點的開放量級和託管單程決定模型的對稱評價,發現其中9個代理決定點的託管模型更準確,既不在零鏡頭模型路由上擊敗機會,作者也糾正了他們自己的數個分析錯誤。
原文: Right Order, Wrong Scale: Auditing LLM Judges for Occupational AI Measurement
與45 796名工人的評級相比,對33名LLM法官的配置進行了審計,作者發現,法官對答覆的排序相當好,但估計接受率從3.0%到97.9%不等,對對應工人來說是61.1%。
原文: ROUTEAUDIT: Interaction-Aware Identification for Budgeted Multi-Verifier Routing
適應性的多核查系統通常透過端點質量成本差距加以比較,即使核查器的目錄、可用性、會計、資訊過濾或計分器隨政策而變化。
原文: FSPO: Policy-Consistent Risk and Pareto-Feasible Control for Budgeted LLM RL Post-Training
適應性LLM強化-培訓後學習可線上改變多個培訓精算師,包括推出溫度,組規模,剪輯,KL規範化,核查員分配,以及更新預算。
原文: Verifiable, Articulable, and Tacit Components of Preference
是什麼讓短篇故事緊緊抓住;一篇新聞文章值得報道;或者數學證據優雅?
儘管離散擴散語言模型(dLMs)成功用於快速平行解碼,但其非平滑的高維空間阻礙了用於推理和推論加速的軌跡引導。
原文: Not Until the Evidence Says So: Teaching LLM Investigators When to Close a Case
本文研究了LLM調查員何時應該結案,利用731個經審計的事故、缺陷和停產案件;它報告說,即使是前沿模型在91%的答覆中都誇大了證據。
原文: Counterexample Generation via Per-Theorem Symbolic Verifiers: When Imitation Hurts and Reinforcement Repairs
大型語言模型往往能解決一個定理向前前進,但卻未能反駁一個密切相關的假說:一個監督微調的偽造漏洞不會關閉,並且會積極惡化。
原文: FinDialogLens: Event Extraction over Multi-Party Dialogue for Missed-Trade Identification in Financial Chatrooms
多方金融聊天室對銷售和交易專業人員至關重要,但其複雜性使得人工回收錯失的行業不可行:每一次引用請求(RFQ)是一個事件,其最終價格和貿易結果在...
原文: APDMem: Agent-Controlled Progressive Disclosure for Query-Adaptive Long-Term Memory
APDMem將長對話歷史組織成四層,從主題摘要向下到原始訊息,只有在查詢需要時才會進行更深的鑽探;在LongMemEval上,它報告強勁的結果,同時讀取約8%的對話。
原文: Lexicographic Multi-Objective On-Policy Distillation
從可核查的獎勵(RLVR)中強化學習通常能最佳化答案的正確性,然而有用的語言模型行為也需要高質量的推理和簡明的回答。
原文: Are you Synthesizing or Recalling? Evaluating LLMs on Algorithmic Code Retrieval
大型語言模型(LLMs)在程式碼生成中表現出了強大的效能,其中的成功既取決於回顧相關的演算法知識和如何應用的推理。
原文: How Causality Bridges the Semantic Gap
數值測量可以捕捉一個系統的行為方式,但往往會留下其變數的含義未加說明。
原文: LEAP: Learning Efficient Action Proposals For LLM Agents
LEAP透過在目標模型自己的動作序列上培訓一個小的起草器模型來加速LLM代理,因此其擬議的動作更經常地匹配,以投機動作回合的延遲框架為指導。
原文: OPD Before RL: Warm-Starting Rubric-Based RL with On-Policy Distillation
許多有用的語言模式任務無法透過確切的結果核查加以評價。
未收錄:
更新: 2026-10-05 20:08 UTC