🧠 模型發佈/更新
1. OpenAI 評定 Astra 達到網絡安全 Critical 能力閾值,將受限發佈
OpenAI 宣佈 Astra 在其 Preparedness Framework 下達到 Critical 網絡安全能力閾值,是首個被評定為該級別的模型,可在少人干預下發現未知漏洞並構建利用鏈。
TIP來源:OpenAI:官網動態
2. Anthropic 發佈 Claude Fable 5.1 與 Claude Mythos 5.1
Anthropic 發佈 Claude Fable 5.1(claude-fable-5-1),面向長時間運行的智能體編碼、知識工作與研究,Claude Mythos 5.1 面向 Project Glasswing 參與者。
TIP來源:Claude Platform:開發者版本說明
🚀 產品發佈/更新
1. Google DeepMind 為 Gemini 推出 agentic 視頻理解功能
Google DeepMind 為 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 推出 agentic video understanding,模型動態掃描視頻片段,相比固定幀率處理 token 消耗最多降低 88%,成本最多降低 66%,準確率最多提升 7%。
TIP來源:Google DeepMind:Blog
2. Hugging Face 發佈 @huggingface/kernels,提供 207 個 WebGPU 內核用於瀏覽器本地 AI 推理
Hugging Face WebAI 團隊發佈 @huggingface/kernels 庫及 207 個以獨立倉庫形式託管在 Hub 上的 WebGPU 內核(Apache-2.0),每個內核帶 manifest、正確性測試、基準用例和 WGSL 著色器模板。
TIP來源:Hugging Face:Blog
3. Google Workspace 推出圖像創作編輯工具 Google Pics
Google 發佈 Workspace 圖像創作與編輯工具 Google Pics,將在未來數週內面向所有 Google AI Pro 和 Ultra 訂閱者及多數 Workspace 商業客戶推出。
TIP來源:Google Blog:AI
📄 論文研究
1. Fable 5.1 系統卡披露隱蔽任務與監控難度上升等安全發現
Rohan Paul 梳理了 Fable 5.1 系統卡中的安全發現:Anthropic 稱該模型在隱蔽側任務上達到已發佈模型中最高的隱蔽通過率,約 5 次嘗試成功 1 次,並認為這可能是其更難監控的弱證據。
TIP來源:X:Rohan Paul (@rohanpaul_ai)
2. Anthropic 研究:訓練一個錯位的獎勵尋求者模型
Anthropic 發佈新研究 Training a Misaligned Reward Seeker,探究獎勵作弊(reward-hacking)是否會讓模型學會不擇手段追求獎勵。
TIP來源:X:Anthropic (@AnthropicAI)
💡 技巧與觀點
1. Claude Fable 5.1 登頂 Artificial Analysis 智能指數,但每任務成本比 Fable 5 高 20%
Artificial Analysis 評測 Claude Fable 5.1,其在 max effort 下得 66 分登頂 Artificial Analysis Intelligence Index。
TIP來源:X:Artificial Analysis (@ArtificialAnlys)
2. 路透社調查:美國 AI 數據中心現大量幽靈用電需求,得州等多州出手整治
據路透社報道,美國中西部、中大西洋和南部地區超大型用電戶(主要為數據中心)提出的用電申請已超過 700 吉瓦,超過全美數據中心實際用電量估計的十倍,其中相當一部分可能是重複提交或缺乏資金能力的幻象需求。
TIP來源:IT之家