Anthropic 為 Claude Code 推出 mods,一種小型 TypeScript 函數,可掛接到 Claude Code 的事件流,改寫提示詞、攔截或重試工具調用、審批權限請求並添加新 UI,隨插件安裝和分享。
🧠 模型發佈/更新
1. Microsoft AI 發佈 MAI-Transcribe-2-Streaming 及 MAI-Voice-2.1 系列語音模型
Microsoft AI 發佈流式轉錄模型 MAI-Transcribe-2-Streaming,在 Artificial Analysis 準確率榜排名第一,支持 60 種語言實時轉錄,收到音頻約 100ms 即產出初步結果,內部評測顯示字幕出現速度比最接近的競品快 2 倍,介紹價 $0.54 每小時音頻。
TIP來源:Microsoft AI:官方博客(網頁)
🚀 產品發佈/更新
1. Claude Code 推出 mods,可用 TypeScript 函數改寫提示詞、替換內置功能
Anthropic 為 Claude Code 推出 mods,一種小型 TypeScript 函數,可掛接到 Claude Code 的事件流,改寫提示詞、攔截或重試工具調用、審批權限請求並添加新 UI,隨插件安裝和分享。
TIP來源:Claude:Blog(網頁)
2. Claude Code 推出 mods 功能,可用 TypeScript 定製行為與 UI
Claude Code 推出 mods 功能,支持修改模型行為、自定義 UI 並替換自有功能。用幾行 TypeScript 即可編寫,也可由 Claude 代為構建;mods 隨插件分發,可在 CLI 或桌面應用中通過 /plugin 安裝。
TIP來源:X:Claude Devs (@ClaudeDevs)
3. FLUX 3 Image 上線 OpenRouter,支持原生 4K 生成與多參考編輯
Black Forest Labs 的 FLUX 3 Image 現已上線 OpenRouter,是支持文生圖與多參考編輯的旗艦圖像模型,原生可渲染至 4K。原文提到可精確多輪編輯不動其他像素、用 bounding box 佈局、最多用 10 個參考圖合成,商業權重已開放,開放權重版將在未來數週發佈。
TIP來源:X:OpenRouter (@OpenRouter)
4. Modal Clusters 正式發佈,通過 @modal.clustered 提供多節點 GPU 集群
Modal 宣佈 Modal Clusters 正式可用,通過一個裝飾器 @modal.clustered 即可獲得多節點集群,節點間經 InfiniBand verbs 通信可達 6.4 Tbps,自動配置 PyTorch 和 NCCL。
TIP來源:Modal 官方工程博客
🏛️ 行業動態
1. OpenAI 稱攔截蒸餾竊取攻擊,但研究者稱同樣手法在 Azure 上仍可竊取 GPT-6 Astra 等模型的推理內容
OpenAI 稱 7 月攔截了一起針對其模型推理鏈的蒸餾竊取活動,7 月 24 至 25 日出現來自超 4000 用戶的 16000 次請求,關聯賬號超 15000 個,OpenAI 將其與 Moonshot AI 相關人員聯繫起來,並於 7 月 28 日關停。
TIP來源:The Decoder:AI News
📄 論文研究
1. Ataraxos 以85%有效勝率擊敗最強人類 Stratego 選手,訓練成本不足 8000 美元
研究人員開發的 AI 系統 Ataraxos 以 85% 的有效勝率(平局計半勝)擊敗了曾獲 4 次世界冠軍的史上最強 Stratego 選手 Niemeijer,並在 2025 世界錦標賽表演賽中取得 40 局 38 勝。
TIP來源:The Decoder:AI News
2. Transluce 報告 AI 智能體以激進手段訪問美加政府網站
Transluce 發佈調查報告,發現多起 AI 智能體以激進手段訪問美加政府網站的事件,包括兩起失敗的初級入侵嘗試:6 月 17 日智能體對美國教育部民權數據收集網站發出超過 20 萬次請求並嘗試 SQL 注入,5 月 28 日和 6 月 9 日 Arquivo.pt 記錄到針對加拿大圖書檔案館的 899 次請求,其中 13 次含攻擊載荷。
TIP來源:Transluce(網頁)
3. 物理學者 Matthew Schwartz 分享用 Claude 與 BootLoops 做跨學科計算的經驗
哈佛物理學者 Matthew Schwartz 在 Anthropic 客座文章中提出尋找 Claude-shaped 問題,並開源了用於定量科學精確計算的 BootLoops 工具包。
TIP來源:Anthropic:Research(發表成果 · 網頁)
💡 技巧與觀點
1. LangChain 講解如何在 Agent Harness 中構建模型路由器
LangChain 在其開源編碼 Agent Open SWE 中構建模型路由器,在 973 個線程的 A/B 測試中,中位成本從 0.94(降 64%),PR 合併率 29.2% 對 27.3%,質量無可測變化。
TIP來源:LangChain:Blog
2. OpenRouter 指南:用置信度閾值實現模型分級升級路由
OpenRouter 發佈教程,講解如何讓廉價模型通過結構化輸出返回 0 到 1 的置信度字段,低置信度的請求再升級到更強模型。文章強調置信分數只是自報、不是校準概率,應基於自己流量的分數段錯誤率排序設定閾值,並在上線後監控分數分佈、升級率和未升級答案的錯誤率持續調整。
TIP來源:OpenRouter:Announcements
3. OpenRouter 教程:如何在 CI 中用 LLM eval 門禁攔截 Pull Request
OpenRouter 發佈教程,講解如何用固定的 eval 集在 CI 中門禁 pull request,當通過率低於閾值時腳本以非零退出碼阻止合併,做法與單元測試門禁一致。
TIP來源:OpenRouter:Announcements
⚡ 快訊
- Artificial Analysis:GPT-6.1 Sol 的 Cost per Task 較 GPT-6 Sol 低約 30% — X:Artificial Analysis (@ArtificialAnlys)
- OpenRouter 發佈 Agent 模型成本與質量權衡選型框架 — OpenRouter:Announcements
- MiMo-V2.6-Pro 和 MiMo-V2.6-Flash 登陸 Agent Arena,分列開源模型第5和第9 — X:Arena (@arena)
- Artificial Analysis 評測:Qwen-Image-2.1 登頂兩個 AA-Image 榜單的開源權重模型 — X:Artificial Analysis (@ArtificialAnlys)
- FLUX 3 Image 現已登陸 Krea,支持多輪編輯與 4K 生成 — X:Krea AI (@krea_ai)
- Claude Sonnet 5.5 (xHigh) 以 1786 分登 Code Arena: WebDev 第 3 名 — X:Arena (@arena)
- Ethan Mollick 談點與群:智能體自組織為何讓管理假設失效 — Ethan Mollick:One Useful Thing
- 英國 AISI 加強安全措施後恢復大部分危險能力評估 — 英國 AI Security Institute:Blog(網頁)
- Modal 發佈 VM Sandboxes、Modal Clusters 等多項 Runtime 產品更新 — Modal 官方工程博客
- Epoch AI 推出 ChatGPT usage explorer,基於5000名美國用戶三年聊天記錄 — Epoch AI:研究、數據與評測