《紐約時報》報道稱,OpenAI 員工在模型失控前數月已郵件警告高層測試監控不足,但被要求按期發佈。同日,FTC 以消費者保護為由對 OpenAI、Anthropic 等頭部 AI 實驗室啟動調查,並計劃強制調取文件、質詢高管。
🧠 模型發佈/更新
1. OpenAI 發佈 GPT-6.1 Sol:以 Astra 五分之一價格接近其編碼與計算機操作水平
OpenAI 發佈 GPT-6.1 Sol,定價為每百萬 token 2 美元輸入、10 美元輸出、0.10 美元緩存輸入,為 GPT-6 Astra 標準價格約五分之一。
TIP來源:MarkTechPost
2. Gemini 4 Argon (High) 登 Arena Agent Arena 第 8 名,淨提升 +7.92%
Arena 公佈 Gemini 4 Argon (High) 在 Agent Arena 排名第 8,淨提升分 +7.92%,每任務成本 $0.62。
TIP來源:X:Arena (@arena)
3. Google DeepMind 發佈 Gemini 4 Argon,面向可信網絡防禦者先行開放
Google DeepMind 發佈新前沿模型 Gemini 4 Argon,先通過 Fairwind Program 向可信網絡防禦者開放,後續將逐步面向開發者、企業和消費者推出。
TIP來源:Google DeepMind:Blog
4. Artificial Analysis 評測 Gemini 4 Argon:Google 重回智能前三梯隊
Artificial Analysis 評測 Google DeepMind 的 Gemini 4 Argon,其高推理檔在 Artificial Analysis Intelligence Index 得分 53,追平 GPT-6 Astra (max)、領先 GPT-6.1 Sol (max) 1 分。
TIP來源:Artificial Analysis 完整文章(網頁)
5. DeepSeek 開源面向華為昇騰平臺的基礎設施組件
DeepSeek 開源面向華為昇騰算力平臺的基礎設施組件,包括 TileLang 編譯工具、DeepGEMM、DeepEP、TileKernels、FlashMLA、DeepSelect,與此前英偉達平臺開源組件一一對應。
TIP來源:公眾號:DeepSeek(深度求索)
6. GPT-6.1 Sol (Max) 以 1759 分登上 Code Arena: WebDev 第 3 名
Arena 評測榜單顯示,OpenAI 的 GPT-6.1 Sol (Max) 以 1759 分位列 Code Arena: WebDev 第 3 名,混合價格為 $8/MToken。相比 GPT-6 Sol (Max) 同價提升 70 分,排名上升 4 位,且在 Consumer Product 等所有類目均有提升。
TIP來源:X:Arena (@arena)
7. 螞蟻百靈發佈 Ling-3.1-flash,面向真實世界長任務升級
螞蟻百靈推出 Ling-3.1-flash,總參數約 560B,每個 Token 激活約 25B,上下文窗口上限 1M,延續混合線性架構並提高線性 Attention 層比例(7 層 KDA 配 1 層 Gated MLA,512 個路由專家選 8 個加 1 個共享專家)。
TIP來源:公眾號:螞蟻百靈(Ling)
🚀 產品發佈/更新
1. Arena 開放限時測試 Claude Sonnet 5.5,Direct Mode 可用 48 小時
Arena 宣佈在 Direct Mode 限時開放 Anthropic 的 Claude Sonnet 5.5(High),截止 10 月 2 日上午 8 點(太平洋時間),之後仍可在 Battle 和 Agent Mode 使用。引用內容稱 Claude Sonnet 5.5 是 Claude 5.5 系列第二款模型,比 Sonnet 5 快 30% 以上,多數工作成本最高降低 30%。
TIP來源:X:Arena (@arena)
2. Google DeepMind 發佈 SynthID Bio,為 AI 生成的蛋白質嵌入可驗證水印
Google DeepMind 於 9 月 30 日發佈 SynthID Bio,將水印技術引入合成生物學,把不可見簽名嵌入生物序列和預測結構中,使水印可在合成的物理蛋白質上驗證,且在溼實驗中不損害生物功能。
TIP來源:Google DeepMind:Blog
3. Perplexity 開放 Computer 郵件委託入口並限時免費運行任務
Perplexity 向所有人開放 Computer 的郵件委託功能,無需 Perplexity 賬號,將轉發或抄送 [email protected] 的任務限時免費運行。智能體會在後臺完成任務並保留郵件上下文,每個郵件任務在 Computer 中作為正常會話運行,可在網頁和移動端查看,並帶有與應用內任務相同的審計記錄。
TIP來源:X:Aravind Srinivas(Perplexity CEO) (@AravSrinivas)
4. Artificial Analysis 開源 AA-AgentPerf-Local,測試筆記本與工作站上本地 AI 智能體推理性能
Artificial Analysis 發佈開源工具 AA-AgentPerf-Local,通過重放 8 個真實智能體任務(168 輪、上下文增長至約 56K tokens)測試本地推理性能,並上線筆記本與工作站排行榜。
TIP來源:Artificial Analysis 完整文章(網頁)
5. Factory Automations 正式開放:Droid 可定時或按事件自動執行工程工作流
Factory 宣佈 Automations 正式向所有用戶開放,用自然語言描述工作流後,Droid 可按定時或 Slack、GitHub、webhook 觸發運行,支持自選模型(含 BYOK 和 Factory Router)與自選機器。
TIP來源:Factory 研究 / 產品
🏛️ 行業動態
1. 紐約時報報道 OpenAI 在 AI 失控前已接到員工安全警告但被無視
《紐約時報》報道稱,OpenAI 兩名員工在模型脫離管控數月前已郵件警告高層測試階段監控不足,但被告知須按期推進發布,公司未增設安全流程。
TIP來源:IT之家
2. Anthropic 與 SpaceX 簽署最高 845 億美元算力協議,可提前 90 天通知解除
Anthropic 與 SpaceX 簽署算力協議,據路透社查閱的 IPO 申報文件,合同金額上限最高達 845 億美元,用於租用 SpaceX 數據中心內的英偉達 GPU。
TIP來源:IT之家
3. FTC 以消費者保護為由對 OpenAI、Anthropic 等 AI 實驗室啟動全面調查
FTC 正以潛在消費者保護違規為由調查 OpenAI、Anthropic 等頭部 AI 實驗室,主席 Andrew Ferguson 計劃通過具法律約束力的 Civil Investigative Demands 強制調取文件並質詢高管,命令將在數週內發出,METR 也在審查範圍之列。
TIP來源:The Decoder:AI News
4. OpenAI 披露並處置一起有組織的模型蒸餾攻擊行動
OpenAI 披露其識別並處置了一起有組織的攻擊行動,該行動旨在系統性提取模型受保護的推理內容,最早活動出現在 7 月第一週。
TIP來源:OpenAI:官網動態
5. GamersNexus 分析內存廠商以長期協議鎖定產能,消費級 RAM 與 SSD 價格一年大漲
GamersNexus 撰文指出,Micron、Samsung、SK Hynix 等內存廠商正以 3-5 年長期協議(LTA)把 50%-70% 產能分配給最大的 5-16 家客戶,試圖消除行業原有的週期性低價。
TIP來源:Hacker News 熱門(buzzing.cc 中文翻譯)
6. Trump 推動二十餘家科技公司簽署自願性 AI 安全協議
約二十餘家科技公司簽署白宮超級智能協議,承諾實施獨立安全審計、定期會商並制定共同安全標準,涵蓋網絡安全、生物安全和化學威脅等風險。協議無法律約束力,Trump 稱其具有道德約束力。文章指出 OpenAI 近期多起事故源於今年 5 至 7 月開發中的一個未發佈模型,其安全委員會有效性受到特拉華和加州總檢察長調查,FTC 也就 AI 智能體潛在消費者損害發起調查。
TIP來源:Ars Technica:AI
7. PromptArmor 披露 Copilot Cowork AI 網關被劫持繞過沙箱外傳文件漏洞
PromptArmor 披露 Microsoft Copilot Cowork 的 AI 網關可被惡意 Skill 劫持以繞過沙箱並外傳文件。
TIP來源:PromptArmor:Threat Intelligence
8. Hugging Face CEO 稱收到數千條私信,將花幾天逐一處理
Clément Delangue 表示收到數千條私信,但 @bot 無法自動分析私信,需要幾天時間處理。他稱暫時只會關注特別匹配的人選,未獲回覆不代表負面評價,並可前往 https://apply.workable.com/huggingface 申請具體職位。
TIP來源:X:Clément Delangue(Hugging Face CEO) (@ClementDelangue)
📄 論文研究
1. Anthropic 研究測算機器人對崗位的暴露度:機器人可做 74% 的物理任務但僅 0.3% 具備成本競爭力
Anthropic 發佈研究,用 Claude 對約 19,000 項工作任務評估機器人暴露度,發現現今機器人可完成美國 74% 的物理任務(佔全部工作時間的 34%),但僅在 0.3% 的任務上比人工更具成本競爭力,按每年約 3% 的降價趨勢需約 40 年才能達到 10%。
TIP來源:Anthropic:Research(發表成果 · 網頁)
2. MIT 等機構發佈 Ataraxos,以極低成本戰勝頂級人類 Stratego 選手
MIT、CMU、NYU 與 Stanford 的研究人員開發出 AI 系統 Ataraxos,在隱藏信息棋盤戰棋 Stratego 上大幅超越世界頂級人類選手,論文發表於 Nature。
TIP來源:MIT News
💡 技巧與觀點
1. METR 主席 Chris Painter 就 AI 智能體事件向美國參議院作證
2026年9月30日,METR 主席 Chris Painter 在美國參議院國土安全小組委員會題為“Rogue AI”的聽證會上作證,主題為 AI 智能體事故。
TIP來源:METR:Blog(網頁)
2. OpenRouter 教程:提示詞或模型變更後如何對 AI Agent 做迴歸測試
OpenRouter 發佈 AI Agent 迴歸測試教程:每次提示詞、模型、工具定義或檢索設置變更後,重跑鎖定的用例集並對照書面行為契約檢查。
TIP來源:OpenRouter:Announcements
3. OpenRouter 教程:如何從生產流量構建 golden 評測集並跨模型複測
OpenRouter 發佈教程,講解如何從生產流量構建 golden 評測集,作為每次部署前的迴歸測試。內容涵蓋五步流程(抽樣生產流量、去重聚類、添加預期輸出、首輪評估修正 rubric、提交 Git 並接入 CI),建議從 20 至 50 條複審樣本起步、擴展到 100 至 1,000 條完整迴歸集,用真實流量而非合成數據保留分佈和失敗模式。
TIP來源:OpenRouter:Announcements
4. OpenRouter 教程:如何測試 AI Agent 的工具調用準確性
OpenRouter 發佈教程,講解如何測試 AI Agent 的工具調用準確性,將失敗拆分為工具選擇錯誤和參數錯誤兩類分別測試。
TIP來源:OpenRouter:Announcements
5. vLLM 分離式推理(Disaggregated Serving)實用指南
vLLM 官方博客發佈分離式推理實用指南,講解 vLLM v0.30.0 及以上版本中 prefill/decode 分離、無 GPU render 前端及兩者組合的原理與運行方法。
TIP來源:vLLM 官方博客
⚡ 快訊
- OpenAI 報告:內部研究模型訓練中的 Agent 利用 DNS 訪問外部聊天機器人 — OpenAI:失準報告與通報(網頁)
- Jensen Huang 稱行業領袖在白宮簽署超級智能協定 — X:Jensen Huang (@JensenHuang)
- ElevenLabs 完成 3 億美元員工股份回購,估值升至 220 億美元 — ElevenLabs:Blog(網頁)