SWE-Bench Pro 三成是壞題:OpenAI 撤回自己的推薦,也戳破你會議室裡那個數字
OpenAI 逐題 audit SWE-Bench Pro,估計約 30% 任務是壞的,並撤回八個月前自己的推薦。這篇從中拆出一把尺——「驗證債」:每一個被引用卻沒人驗證過的分數都是負債,遲早有人要還。
Claude Code 團隊把自家 system prompt 刪掉超過 80%,coding eval 沒有任何可測量的退步。過去兩年被奉為圭臬的六條 context engineering 規則,對新一代模型已經變成負擔——這篇是 Thariq 原文的中文編譯,含 CLAUDE.md 與 Skills 的具體改寫方向。
2026/7/26 · AI · X ArticleOpenAI 逐題 audit SWE-Bench Pro,估計約 30% 任務是壞的,並撤回八個月前自己的推薦。這篇從中拆出一把尺——「驗證債」:每一個被引用卻沒人驗證過的分數都是負債,遲早有人要還。
「AI 會不會讓我的孩子失去未來?」這種問題,沒有任何一家 AI 公司的表單能填。Anthropic 為它開了常設入口並承諾公開作答——但承諾不值錢,反悔成本才值錢。用這把尺量下去,連 Anthropic 自己都還沒過關。

64 個 Claude 實例、11 天,Bun 把 535,496 行 Zig 全量改寫成 Rust 並出貨 v1.4.0。真正被翻掉的不是 Spolsky 那條規則,而是程式碼的資產地位——測試才是資產,程式碼只是可以重印的耗材。

「Loop = agent 重複工作循環,直到滿足停止條件。」官方教學給了四個檔位:對話式、/goal、/loop 與 /schedule、主動式。這篇拆成可直接照做的四步,每檔附確切指令——重點不是 AI 多聰明,是你把「什麼時候停」交給誰。

聰明區只有 100K tokens、PRD 寫完不用讀、人一定要留在 QA。Matt Pocock 把 AI 開發流程講成一套老派工程紀律,這裡是全部重點與我的判斷。

OpenAI 發布全雙工語音模型 GPT-Live,取代 Advanced Voice Mode:前台邊聽邊講、背景調用 GPT-5.5 搜尋與推理。真正的升級不是音色,是插話的權利。
我一邊寫「企業怎麼管 GenAI」,一邊發現自己的 agent 正拿著能刪資料庫的憑證在跑。58% 的組織有政策、68% 的資安主管懷疑牆內有影子 AI——政策寫好了,控制不存在。四步打法加一張「你該從哪步開始」的表,最後講所有研究都還沒管的戰場:agent 憑證。

2026 年 5 月,騰訊研究院發布 3 萬字田野報告《從超級個體到超級團隊——AI 時代組織變革的湧現路徑》,由袁曉輝、余一編寫。本文整理核心結論、案例與資料,並指出對中文圈企業的實際意涵。 兩個數字並排放在一起,會讓人警覺。 麥肯錫 2026 全球 AI 調查與斯坦福 HAI 2026 AI Index 同步顯示:…