Quảng cáo bên trong ChatGPT tiếp tục phát triển: OpenAI đang thêm một định dạng quảng cáo hình ảnh cộng với đo lường, xác nhận và công cụ phù hợp với thương hiệu, mà quan trọng cho cả thị trường và người dùng hàng ngày.
Một cái nhìn cụ thể về cách một trong những phòng thí nghiệm lớn có kế hoạch xử lý các quy tắc về sự xuất hiện văn bản của EU, bao gồm nơi mà các dấu hiệu nước áp dụng và tại sao truy cập phát hiện bắt đầu với các nhà nghiên cứu.
Một bài báo hiếm khi kiểm tra lại tiêu đề của nó: các tác giả báo cáo rằng sửa chữa lỗi phân tích của họ cắt giảm 23.9% giá được cho là tiết kiệm được 4.3%, một sự cẩn thận có ích cho bất cứ ai đánh giá các mô hình định hướng đặc vụ.
arXiv
Ghi chú biên tập: Các bản tóm tắt được soạn nháp với sự hỗ trợ của AI dựa trên văn bản của từng nhà xuất bản và đang chờ con người duyệt lại.
Từ các công ty và phòng nghiên cứu AI
Bài đăng từ blog chính thức của các công ty và phòng nghiên cứu trong 7 ngày qua.
OpenAI mô tả làm thế nào nó đang tiếp cận văn bản đánh dấu theo quy tắc EU: nơi các dấu ấn được áp dụng, cách phát hiện hoạt động, và tại sao việc tiếp cận để phát hiện bắt đầu từ các nhà nghiên cứu.
Bản gốc: Building advertising for the way people use AI
OpenAI giới thiệu một định dạng quảng cáo hình ảnh mới trong ChatGPT và mở rộng công cụ đo lường, hợp tác hợp tác và điều khiển phù hợp với thương hiệu cho các nhà quảng cáo.
Bản gốc: Together Link: open models in the harness you already use. Start with one command today.
Cùng với nhau AI's Link mang lại các mô hình mở như GLM 5.3 và Kimi K3 thành các đặc vụ mã hóa đã sử dụng; cùng nhau nói rằng nó có thể cắt giảm mô hình chi tiêu hơn 50%.
Together AI · · Tóm tắt
Tin AI nổi bật trên Hacker News
Các bài có tiêu đề liên quan đến AI, xếp theo điểm trong 36 giờ qua.
Một đánh giá đôi của một cân mở và một mô hình máy chủ một quyết định vượt qua 11 điểm quyết định đặc vụ tìm thấy các mô hình máy chính xác hơn trên 9 trong số họ, không đánh bại cơ hội định tuyến bằng không chụp, và các tác giả sửa chữa một số lỗi phân tích của riêng họ.
Bản gốc: Right Order, Wrong Scale: Auditing LLM Judges for Occupational AI Measurement
Dựa trên các cấu hình đánh giá 33 LLM so với 45.796 người công nhân, các tác giả thấy các quan tòa có thể xếp hạng các phản ứng hợp lý nhưng ước tính được tỷ lệ chấp nhận ở bất cứ đâu từ 3.0% đến 97.9%, so với 61.1% cho các công nhân phù hợp.
arXiv · · Harry Lyu, Neil Thompson · cs.AI cs.CL cs.CY cs.LG · Tóm tắt
Bản gốc: ROUTEAUDIT: Interaction-Aware Identification for Budgeted Multi-Verifier Routing
Các hệ thống đa chiều thường được so sánh thông qua các khoảng trống chất lượng-giá trị cuối cùng, ngay cả khi danh mục tìm kiếm, có sẵn, kế toán, lọc thông tin, hoặc ghi điểm thay đổi chính sách.
Bản gốc: FSPO: Policy-Consistent Risk and Pareto-Feasible Control for Budgeted LLM RL Post-Training
Adaptive LLM tăng cường học tập sau khi đào tạo thay đổi nhiều trình diễn đào tạo trực tuyến, bao gồm nhiệt độ trượt, kích thước nhóm, clip, KL bình thường hóa, phân bổ xác minh, và ngân sách cập nhật.
Bản gốc: Large Language Continuous Diffusion Models
Bất chấp sự thành công của các mô hình ngôn ngữ phân tán rời rạc (dLMs) cho giải mã song song nhanh, không gian không gian cao, cao cản trở việc điều khiển quỹ đạo cho lý luận và tăng tốc độ suy luận.
Bản gốc: Not Until the Evidence Says So: Teaching LLM Investigators When to Close a Case
Tờ báo này nghiên cứu khi các điều tra viên LLM kết thúc một vụ, sử dụng vụ tai nạn kiểm toán 731, khuyết tật và các vụ mất việc; báo cáo rằng ngay cả một mô hình biên giới cũng phóng đại bằng chứng của vụ án lên đến 91% các câu trả lời.
Bản gốc: Counterexample Generation via Per-Theorem Symbolic Verifiers: When Imitation Hurts and Reinforcement Repairs
Các mô hình ngôn ngữ lớn thường giải quyết một định lý về phía trước nhưng không thể bác bỏ một sự sai lầm liên quan chặt chẽ: một khoảng cách giả tạo mà giám sát tinh chỉnh không đóng lại và có thể tích cực tồi tệ hơn.
Bản gốc: FinDialogLens: Event Extraction over Multi-Party Dialogue for Missed-Trade Identification in Financial Chatrooms
Multi-party financial chatrooms are vital for sales-and-trading professionals, but their complexity makes manual recovery of missed trades infeasible: each Request for Quote (RFQ) is an event whose final price and trade outcome appear many messages after the…
arXiv · · Chin-Lun Fu, Hong Ni, Behrouz Madahian · cs.CL cs.AI · Trích từ tóm tắt (arXiv, CC0)
Bản gốc: APDMem: Agent-Controlled Progressive Disclosure for Query-Adaptive Long-Term Memory
ADMMMm tổ chức một lịch sử nói chuyện dài thành bốn lớp, từ các bản tóm tắt xuống các thông điệp thô, và khoan sâu hơn chỉ khi một yêu cầu cần thiết; trên LongMemEval nó báo cáo kết quả mạnh mẽ trong khi đọc khoảng 8% các cuộc trò chuyện.
arXiv · · Chin-Lun Fu, Anagha Kulkarni, Hong Ni +1 · cs.CL cs.AI · Tóm tắt
Bản gốc: Lexicographic Multi-Objective On-Policy Distillation
Sự tiếp sức học hỏi từ phần thưởng có thể kiểm chứng (RLVR) thường tối ưu hóa trả lời chính xác, nhưng có ích trong hành vi ngôn ngữ mô phỏng cũng yêu cầu lý luận chất lượng cao và trả lời ngắn gọn.
arXiv · · Doseok Jang, Jon Ander Campos, Youran Qi · cs.LG cs.AI cs.CL · Trích từ tóm tắt (arXiv, CC0)
Bản gốc: Are you Synthesizing or Recalling? Evaluating LLMs on Algorithmic Code Retrieval
Các mô hình ngôn ngữ lớn (LMs) đã cho thấy hiệu suất mạnh mẽ trong thế hệ mật mã, nơi thành công phụ thuộc vào việc nhớ lại kiến thức thuật toán và lý luận về cách áp dụng nó.
arXiv · · Nickil Maveli, Antonio Vergari, Shay B. Cohen · cs.LG cs.AI cs.CL cs.PL · Trích từ tóm tắt (arXiv, CC0)
Bản gốc: LEAP: Learning Efficient Action Proposals For LLM Agents
LEAP tăng tốc các đặc vụ LLM bằng cách đào tạo một mô hình nhỏ về các mô hình hành động của chính mục tiêu để các hành động của nó phù hợp thường xuyên hơn, được hướng dẫn bởi một cơ sở tiện lợi cho các vòng hành động suy đoán.