🧠 模型發佈/更新
1. GPT-5.6 登陸 Kiro,為開發者提升性價比
GPT-5.6 模型家族現已登陸軟件開發智能體 Kiro,包含 Sol、Terra 和 Luna 三款模型。在 Terminal-Bench 2.1 測試中,GPT-5.6 Terra 在 Kiro 內完成任務成本降低約 82%。該更新由 OpenAI 與 AWS 合作優化,旨在以更少迭代和更高 token 價值幫助開發者產出更高質量的代碼。
TIP來源:OpenAI:官網動態
🚀 產品發佈/更新
1. NVIDIA Vera Rubin NVL72 樹立 AI 智能體效率新標準:每瓦特工作量提升至 30 倍
NVIDIA 實測數據顯示,Vera Rubin NVL72 在智能體工作負載下每兆瓦吞吐量較 GB300 NVL72 最高提升 30 倍,每百萬 token 成本降低至 35 倍。
TIP來源:NVIDIA Blog
2. MetaRoCE:為 AI 規模以太網打造的全新 RDMA 傳輸協議
Meta 設計並開源了 MetaRoCE,一個專為 AI 工作負載在通用以太網上打造的 RDMA 傳輸協議,已通過 Open Compute Project(OCP)發佈規範、參考軟件實現和合規測試套件。該協議將智能移至端點,原生支持亂序交付、多路徑、無損容忍和雙向擁塞控制,無需 PFC,可在百萬 GPU 規模下提供高吞吐、低尾延遲。現有 RDMA Verbs API 和軟件棧無需修改即可運行。
TIP來源:Meta Engineering Blog
3. NVIDIA 如何用 NVLink Fusion 讓定製 XPU 融入世界級 AI 工廠
NVIDIA 推出 NVLink Fusion,將定製 XPU 接入其 NVLink 擴展域,使 XPU 間端到端延遲比基於現成以太網的方案低 3 倍、數據包速率高 10 倍。
TIP來源:NVIDIA Blog
4. MTIA 300:Meta 首款內置 NIC 與通信卸載引擎的訓練芯片
Meta 發佈 MTIA 300,這是其自研加速器家族中首款針對推薦與排序模型訓練優化的芯片。芯片封裝內集成 12 個 800 Gbps RDMA NIC,提供 1.2 TB/s 總 I/O 帶寬,並通過 16 個專用消息引擎卸載通信,使大規模 GEMM 與集合通信併發時計算吞吐損耗低於 0.5%。
TIP來源:Meta Engineering Blog
5. NVIDIA 擴展 Vera Rubin 推理能力,Groq 3 LPX 全面投產支持智能體系統
NVIDIA 宣佈 Vera Rubin NVL72 擴展快速 token 生成能力,以支持智能體系統。其機架級系統 NVIDIA Groq 3 LPX 已全面投產,旨在通過 AI 工廠各層協同工作來定義下一代 AI 推理,而非依賴單一芯片、網絡或系統的突破。
TIP來源:NVIDIA Blog
🏛️ 行業動態
1. Mistral 與 HUMAIN 達成戰略合作,推進沙特及中東主權 AI
Mistral 與 HUMAIN 宣佈達成戰略合作,覆蓋 AI 基礎設施、先進模型開發及 AI 解決方案部署,聚焦沙特阿拉伯及更廣泛地區。雙方將合作開發本地化 AI 模型,初期重點包括網絡安全和語音,並計劃開發在阿拉伯語上表現強勁的前沿模型。該合作金額達數億歐元,Mistral 將探索使用 HUMAIN 的數據中心基礎設施,並計劃在沙特針對受監管行業制定聯合市場策略。
TIP來源:Mistral AI:News(網頁)
2. 豐田北美如何用 Deep Agents 和 LangSmith 規模化企業 AI
豐田北美藉助 Deep Agents 和 LangSmith 運行 50 多個生產環境 AI 智能體,將交付週期從 6 個月縮短至 4 天。文章展示了其如何通過 LangSmith 追蹤 AI 投資回報率(ROI),並以此支撐企業級 AI 的規模化落地。
TIP來源:LangChain:Blog
📄 論文研究
1. Beyond Visual CoT:Internalized Visual Thinking 實現主動視頻推理
多模態大語言模型常用視覺思維鏈(Visual CoT)進行空間、時間與具身環境推理,但生成中間推理圖像帶來大量推理開銷。新提出的後訓練框架 Internalized Visual Thinking(IVT)在訓練階段內化視覺思考,推理時直接進行文本預測與優化,從而在不增加推理成本的前提下實現主動視頻推理。
TIP來源:Apple Machine Learning Research
💡 技巧與觀點
1. OpenAI 正為一切構建 AI 智能體,但用戶會願意交出控制權嗎?
OpenAI 推出 ChatGPT Work,將 Codex 改造為面向非工程師的智能體產品,最低訂閱檔每月 20 美元即可使用,旨在讓白領通過 LLM 自主完成多步驟工作。OpenAI 內部 6 月有 98% 員工使用 Codex,但組織訂閱者僅 17%、個人訂閱者不足 1%。公司正通過簡化界面擴大采用,以支撐其鉅額訓練投入。
TIP來源:TechCrunch:AI
2. ADK 如何評估實時語音智能體
Google 為 ADK 帶來原生實時評估能力,可用模擬用戶以音頻驅動實時語音智能體、對語音回覆打分,並在與文本智能體相同的評估循環中完成。示例採用三個基於 gemini-live-2.5-flash-native-audio 的智能體組成工作流,支持對話場景與固定對話兩種測試用例,內置 NOVICE 等用戶人設,並以 max_allowed_invocations 限制總輪數。
TIP來源:Google Developers Blog
3. Databricks 如何從本地 IDE 運行、調試和擴展工作負載
Databricks 工作區專為數據分析和數據工程而構建,現支持從本地 IDE 直接運行、調試和擴展工作負載。該功能旨在彌合本地開發環境與雲端 Databricks 平臺之間的差距,讓開發者無需切換上下文即可完成編碼、測試和部署。
TIP來源:Databricks:Blog
4. 你的alt文本能通過自動化檢查,不代表它真的合格
WebAIM Million報告顯示,主流網頁中16.2%的圖片缺少alt文本,另有10.8%的alt文本模糊或重複。GitHub為Accessibility Scanner構建了alt文本插件,採用五條確定性規則檢測缺失、文件名、佔位符、泛化詞及相鄰重複,並引入基於佈局的重複檢測和可選視覺模型審查,以平衡誤報率與實用性。
TIP來源:GitHub Blog
5. Anthropic 市場人員如何用 Claude Code 每週為每位銷售代表發送個性化更新
Anthropic 市場團隊成員 Adam Ward 分享如何用 Claude Code 將每週銷售報告轉化為每位客戶經理的個性化週一簡報。他通過 MCP 連接 BigQuery 和 CRM 數據,並依據銷售與經理反饋迭代提示詞,加入“絕不編造 URL”等九條內容規則。該簡報現已推廣至所有銷售團隊,每週一自動發送三條優先行動項及賬戶相關活動。
TIP來源:Claude:Blog(網頁)