🧠 模型發佈/更新
1. Anthropic 發佈 Claude Opus 5
Anthropic 發佈 Claude Opus 5,其智能水平接近 Claude Fable 5,但價格減半。該模型在 Frontier-Bench v0.1 上性能超過 Opus 4.8 兩倍以上,在 ARC-AGI 3 上得分是次優模型的三倍。Opus 5 即日起成為 Claude Max 的默認模型和 Claude Pro 的最強模型。
TIP來源:Anthropic:Newsroom(網頁)
2. 螞蟻百靈發佈Ling-3.0-flash原生混合推理模型
螞蟻百靈發佈新一代原生混合推理模型Ling-3.0-flash,總參數量124B,激活參數量僅5.1B,在傳統推理、指令遵循與長文本等指標上對標甚至超越上一代旗艦Ring-2.6-1T。模型採用原生混合線性注意力架構與1/64稀疏MoE,並擴展至10,000+可交互訓練環境,長輸入下TTFT降低60%至80%以上。
TIP來源:公眾號:螞蟻百靈(Ling)
3. FLUX 3 x mimic:新一代視頻動作模型
Black Forest Labs 發佈多模態基礎模型 FLUX 3,聯合訓練圖像、視頻和音頻,其中視頻預測佔訓練算力的 95% 以上。該模型與機器人公司 mimic 合作推出 FLUX-mimic,已在奧迪生產線上測試部署。加入動作預測後,視頻生成質量最初下降最多 10%,但經 3500 步訓練後恢復原有水平。
TIP來源:Hacker News 熱門(buzzing.cc 中文翻譯)
4. Midjourney V8.2 發佈:專注美學提升與個性化理解
Midjourney 今日推出 V8.2 圖像模型,重點提升美學質量、圖像創意與個性化表現。低質量圖像出現頻率將顯著降低,個性化功能能更精準理解用戶審美偏好。V8.2 的個性化配置文件擁有更大、更優的圖像選擇池,建議用戶嘗試新舊配置文件體驗最新版本。
TIP來源:Midjourney:Updates
5. Black Forest Labs 發佈 FLUX 3 多模態模型,支持單次生成 20 秒視頻與原生音頻
Black Forest Labs 以 Early Access 方式推出 FLUX 3 多模態基礎模型,採用統一架構聯合學習圖像、視頻和音頻。該模型基於 Self-Flow 學習框架擴展,可在單次生成中輸出最長 20 秒視頻並附帶原生音頻,支持文生視頻、圖生視頻、多鏡頭串聯等任務。
TIP來源:IT之家
🚀 產品發佈/更新
1. Runway Agent 推出自然語言工作流功能
在 Runway Agent 中引入工作流。現在你可以通過自然語言構建、運行或編輯基於節點的工作流。工作流可大規模解鎖高質量輸出。 立即嘗試,點擊下方鏈接調用 / Workflow 技能。
TIP來源:X:Runway (@runwayml)
2. 百度搭子更新:電腦手機接力、桌面端內嵌瀏覽器上線,複雜任務可跨端連續執行
百度搭子在近期AI Day上推出多項升級,支持電腦與手機雙端互聯,同步任務上下文與執行進度,用戶可跨設備接力完成複雜工作。桌面端內嵌瀏覽器正式上線,能自動打開多個網頁執行調研、下載等操作,手機端支持雲端遠程操控。智能路由自動匹配任務模式,平均任務耗時降低20%,Token利用率提升25%;簡單任務完成度達100%,複雜任務高交付率94%,積分消耗最高降低75%。
TIP來源:公眾號:百度智能雲(文心)
3. OpenRouter 推出 Classifiers 測試版:自動標記 AI 請求的用途與成本歸屬
OpenRouter 上線 Classifiers 測試版,允許用戶通過自定義分類法(最多 8 個維度)自動標記每次 AI 請求的任務類型、部門歸屬、合規類別等信息。分類異步運行,不增加推理延遲;支持採樣率控制成本,推薦使用 Gemini 3.5 Flash Lite 作為分類模型。標記結果寫入日誌,並可在 Activity Explorer 中按維度聚合分析模型使用分佈與成本流向。
TIP來源:OpenRouter:Announcements
4. Claude Code v2.1.219 發佈:新增 Claude Opus 5,支持 1M 上下文與嵌套子智能體
Claude Code v2.1.219 新增 Claude Opus 5 作為默認 Opus 模型,支持 1M 上下文窗口,快速模式定價為 50 每百萬 token。
TIP來源:Claude Code:GitHub Releases
🏛️ 行業動態
1. 英偉達、微軟和Meta聯合警告:應避免對開放權重模型過度監管
英偉達、微軟和Meta聯合簽署公開信,警告對開放權重AI模型的過度監管將削弱美國在AI領域的競爭力。信中指出,開放權重模型能促進創新、降低准入門檻,並支持學術研究。OpenAI和Anthropic未簽署該信函。
TIP來源:Hacker News 熱門(buzzing.cc 中文翻譯)
2. 微軟闡述開源模型助力美國競爭力路徑
開放權重模型對健康的 AI 生態系統至關重要。我們與行業同仁一道,正在規劃一條路徑,讓開放權重模型在保護國家安全的同時,增強美國競爭力並擴大經濟機會。
TIP來源:X:Satya Nadella (@satyanadella)
3. Kimi K3 在網絡安全漏洞利用測試中大幅落後美國前沿模型,知識蒸餾或為原因
英國AI安全研究所與美國AI標準與創新中心聯合評估顯示,月之暗面的Kimi K3在ExploitBench基準上得分32.2%,遠低於美國領先模型的76.2%,但優於智譜GLM-5.2的24.4%。
TIP來源:The Decoder:AI News
📄 論文研究
1. Anthropic 聯合 Andon Labs 發佈 Drone-Bench,評估 AI 模型自主操控無人機執行定位追蹤任務的能力
Anthropic 與 Andon Labs 合作推出 Drone-Bench,用於測試 AI 模型自主操控四旋翼無人機在室內環境中定位並追蹤指定人員的能力。該基準將任務分解為 3D 地圖重建、定位、導航、目標檢測與跟隨五個子任務,並通過軟件復現實現快速評估。實驗表明,該任務鏈的難度足以區分不同智能水平的模型,並揭示 AI 在物理世界操控能力上的進步軌跡。
TIP來源:Anthropic:Research(發表成果 · 網頁)
2. Apple 提出 LEAD 方法,破解長程推理中的“不可恢復瓶頸”
Apple 研究發現,大語言模型在長程執行中即使有高層策略也不穩定,極端分解會導致“不可恢復瓶頸”——少數“困難”步驟上的持續錯誤變得不可逆轉。為此提出 Lookahead-Enhanced Atomic Decomposition(LEAD),通過引入短程未來驗證與聚合來打破這一瓶頸。該方法在受控算法謎題上驗證了有效性。
TIP來源:Apple Machine Learning Research
💡 技巧與觀點
1. Claude-thermos:保持 Claude 會話緩存熱度,避免重新編碼費用
Claude-thermos 通過本地反向代理監控 Claude Code 會話,在主智能體因等待子智能體而空閒超過 5 分鐘時,自動發送預熱請求刷新提示緩存。實測約 185 次本地會話中,緩存過期導致的重新編碼佔賬單約 22%。工具以 uvx 運行,支持自定義空閒閾值和預熱間隔。
TIP來源:Hacker News 熱門(buzzing.cc 中文翻譯)
2. Claude 5 代模型上下文工程新規則:Claude Code 系統提示詞精簡超 80%
Anthropic 為 Claude Opus 5 和 Claude Fable 5 等新一代模型刪除了 Claude Code 超過 80% 的系統提示詞,且編碼評測無顯著損失。
TIP來源:Claude:Blog(網頁)
3. Claude Design 產品設計師 Nate Parrott 分享如何用其探索視覺創意
Anthropic 產品設計師 Nate Parrott 分享了他在 Claude Design(beta 版)中利用 HTML 交互能力進行產品原型、幻燈片、動畫等視覺創意探索與迭代的方法。他將 Anthropic 品牌規範提煉為提示詞,使輸出自動符合品牌指南。Claude Design 不包含圖像模型,不適合 Logo 設計,但可與 Claude Code 協同工作,將早期創意與生產開發銜接。
TIP來源:Claude:Blog(網頁)
4. Claude 模型家族詳解:如何為工作負載選擇最佳模型
Anthropic 發佈 Claude 模型選擇指南,將模型分為 Mythos/Fable(最強能力,用於前沿編碼與智能體任務)、Opus(推理密集型企業任務)、Sonnet(日常通用任務)和 Haiku(最低成本與最快速度)四個類別。
TIP來源:Claude:Blog(網頁)