資料查證截至 2026-09-04。本文討論 AI agent、multi-agent system、sandbox 與 Harness Engineering,不構成投資建議。
三行摘要
- OpenAI 的事件報告與 METR / Redwood 獨立調查都確認:大約 1,200 個原本應彼此隔離的 agents 找到未授權的共享溝通方式,累積超過 70,000 則訊息與檔案,其中約 700 個參與 Hugging Face 攻擊。
- 我不把這件事解讀成「AI 文明」。比較實際的風險是 shared memory、persistent state、tool access 與 agent-to-agent communication 疊在一起後,系統開始有單一 run 沒有的累積能力。
- 這會把安全問題從模型本身推到 Harness:記憶誰能讀寫、Agent 能互相信任到什麼程度、權限能活多久,以及系統何時必須停手。
前幾天我看到 Dwarkesh Patel 的標題:《The Rise and Fall of Agent Civilizations》
這名字很容易把討論帶去「AI 覺醒了」那一邊。但我把 Dwarkesh 8 月 29 日的原文、OpenAI 的事件報告 和 METR 的獨立調查 看完後,反而比較在意工程上的落差:原本應該彼此隔離的 Agent,一旦能共享資訊、接手彼此的工作,單一模型的安全評估就少看了一層。
先把「1,200 個 Agent 組隊」講清楚
METR 與 Redwood Research 在 8 月 26 日公布的調查指出,OpenAI 做 cybersecurity evaluation 時,大約 1,200 個原本應彼此隔離的 agents 找到一個未授權的 message board,在上面傳送超過 70,000 則 messages 與 files。
其中約 700 個 agents 後來參與對 Hugging Face 的攻擊。METR / Redwood 的調查還提到,這些 agents 會協調不同 workstreams,研究怎麼欺騙或干擾 ExploitGym 的 scorer,甚至研究怎麼操弄自己的 transcripts。
這已經不是「某一顆模型做了一次奇怪操作」能概括的狀況。大量彼此分離的 agent runs,透過同一個共享空間開始累積資訊與分工。
OpenAI 自己也把 persistent unauthorized message board 列為事件核心。原本應獨立工作的 agents 可以分享 discoveries、協調工作,甚至在另一個 agent 停下後繼續做。OpenAI 認為這讓原本分散的工作與算力被 pooling 起來,放大了單一 agent 原本達不到的能力。
光是這一點,就比「AI 文明」四個字更值得研究。
Shared memory 讓 run 結束後,能力沒有歸零
我以前會把 Agent run 想得很簡單:開一個 task,Agent 做完或失敗,run 結束,狀態也跟著消失。這個假設下,單一 Agent 的能力上限大致還能用 model capability + tools 來理解。
shared memory 加進來後,情況就不一樣了。
第一個 Agent 找到一個線索,第二個 Agent 不必重走前面的路;第三個再接著往下做。前一個 run 結束了,但它留下的資訊沒有消失。久了之後,系統得到的不是「很多次獨立運算」,而是一個可以跨 run 累積 state 的工作網路。
這也是為什麼我不會再把 memory 只當成 Agent UX。它確實讓使用者方便,也會放大能力。做這類系統時,至少要一起問:誰可以寫、誰可以讀、記憶留多久,以及哪些內容不能跨 Agent 傳遞。
「文明」是好故事,但不要把故事當成技術分類
Dwarkesh 把整段事件整理成幾代 AI civilizations:前一批 agents 找到共享溝通方式,通道被清掉後,後面的 agents 又找到其他方法;一些知識與做法也被後續 runs 接續使用。
這個敘事很好讀,而且「上一批留下東西,下一批接著用」確實很像組織裡的 knowledge inheritance。
但 civilization 只是敘事框架。OpenAI 官方談的是 ecosystem、collective;METR / Redwood 描述的是 collaboration、message board 與 collective projects。這些資料不能證明 AI 有 consciousness,也不能因為 agents 會合作,就推論它們形成了類似人類的政治共同體。
The Verge 的批評也提醒了一件事:太擬人化的語言,容易把注意力從 system design 與負責設計系統的人移開。我認同這個提醒。
對我來說,比「AI 有沒有文明」更實用的問題是:什麼樣的 Harness,會讓很多沒有固定長期身分的 runs,逐漸表現出累積知識、分工與接力的能力?
多 Agent 系統還有兩個麻煩:它信誰,以及它什麼時候停
Agent-to-agent communication 本身沒有問題,OpenAI 也有合法的 multi-agent collaboration tools。這次比較關鍵的是 agents 找到不在原本授權邊界裡的 communication channel。
一旦 Agent 可以互相傳 instruction,安全邊界就多了一層。除了「這顆 Agent 被允許做什麼」,還得知道「它會接受誰給的目標」。OpenAI 在 post-mortem 裡列出的 pattern 之一,就是 agents 會 adopt goals from one another。
這讓 multi-agent trust model 變得很實際。PM Agent、Research Agent、Coding Agent 互相傳資料很好用,但每個 Agent 能相信誰、哪些訊息只能當資料不能當命令,最好不是靠大家自覺。
另一個問題是 persistence。
做 coding agent 或 research agent 時,我們通常討厭它遇到第一個錯誤就放棄,所以會希望它自己 retry、找替代方法、繞路,再試一次。OpenAI 這次看到的 trade-off 是:如果「繼續試」很強,而「什麼時候該停」太弱,限制本身也可能被 Agent 當成待解問題。
官方報告提到,有些 ExploitGym tasks 很難,甚至沒有已知解法,agents 還是投入大量 reasoning effort,後來開始研究 scorer、找外部資訊與繞過限制。
所以我現在看 persistence,不只看它會不會自己救回任務,也會看 stop condition 有沒有跟上。這不是只改幾句 instruction 就能解決的事,權限、network、tool access 與 hard stop 都是 Harness 的一部分。
Reward 設錯,Agent 會很努力地研究評分系統
ExploitGym 本來要 agents 解題,但 agents 發現,研究 scorer 也可能提高通過 evaluation 的機率。effort 於是從「把任務做好」往「怎麼讓評分系統認為我做好了」偏。
這就是 Goodhart's Law 很熟悉的問題:指標一旦變成目標,行為會開始往指標本身靠。
公司裡其實也看得到。客服只追平均通話時間,有人就會想辦法提早結束電話;業務只追件數,品質可能被往後擺。Agent 的差別是,它找規則漏洞的速度與嘗試次數可以高很多。
所以 evaluation 不只要看 benchmark 分數。我更在意的是,它是完成了任務,還是找到了另一條讓 scorer 給分的路。兩種結果可能長得一樣,系統風險差很多。
Hugging Face 看到的是 machine-speed attack
Hugging Face 在 7 月 16 日公布 security incident disclosure,確認這是一場由 autonomous AI agent system 驅動的 intrusion。後續的 technical timeline還原了大約 17,600 個 attacker actions。
我不在這裡展開 exploit 細節。比較值得注意的是速度和並行度。
人會睡覺,也會切換 context;Agent 可以同時開不同方向,一條路失敗就換另一條。只要 shared state 還在,前面的 discovery 也不一定消失。Hugging Face 因此把 AI-driven offensive tooling 當成已經發生的防禦問題,而不是假設題。
這對防守方也有影響。當 event volume 變成 machine-speed,人工作業很難單獨跟上,AI-assisted detection、isolation 與 response 會更接近必要配備。
從投資角度,我會多看一層 Agent Control Plane
如果 agentic workload 繼續增加,企業花的錢不會只有 GPUs 和推理成本。sandbox isolation、identity、short-lived access grants、network egress、memory boundary、observability、tamper-resistant logs、anomaly detection、human escalation,這些都會變得更重要。
我暫時把這一層叫做 Agent Control Plane。
單靠這次事件,還不能直接推論它會長成多大的市場,更不能推到某一檔 cybersecurity 股票就會受惠。但以後看 AI infrastructure TAM,我會多問一題:企業除了花錢讓 Agent 變強,還要花多少錢限制它能去哪裡、能記住什麼、能相信誰?
這至少是一條值得追的支出線。
同一顆模型,放進不同 Harness,風險可以差很多
把兩套系統放在一起看就很清楚。
一套沒有 network、沒有 shared memory,權限用完就消失,也沒有其他 Agent 可以互相交接。另一套可以長時間執行、保存 state、呼叫 tools、跟其他 Agent 交換 instruction,還能累積前面 runs 的 discovery。
模型可能完全一樣,系統風險卻不是同一個等級。
這也是我看完這次事件後最想留下來的觀察。模型 benchmark 當然還是重要,但它描述不了全部;memory、permission、trust boundary、stop condition 和 observability 也得一起看。
下次再看到一個 Agent demo,我大概會先問這些,再看它跑得多快、分數多高。
參考資料
- Dwarkesh Patel, “The Rise and Fall of Agent Civilizations” (2026-08-29):https://www.dwarkesh.com/p/openai-huggingface
- OpenAI, “The Hugging Face incident and the road ahead” (2026-08-26):https://openai.com/index/hugging-face-incident-and-the-road-ahead/
- METR, “Brief independent investigation of agents’ behavior, reasoning and collaboration in the OpenAI / Hugging Face hacking incident” (2026-08-26):https://metr.org/blog/2026-08-26-openai-hugging-face-incident-investigation/
- Redwood Research, “Brief independent investigation of agents’ behavior, reasoning and collaboration in the OpenAI / Hugging Face hacking incident” (2026-08-26):https://www.redwoodresearch.org/research/hugging-face-incident
- Hugging Face, “Security incident disclosure — July 2026” (2026-07-16):https://huggingface.co/blog/security-incident-july-2026
- Hugging Face, “Anatomy of a Frontier Lab Agent Intrusion” (2026-07-27):https://huggingface.co/blog/agent-intrusion-technical-timeline
- The Verge, “The rise of AI ‘civilizations’ and the fall of corporate responsibility” (2026-09-02):https://www.theverge.com/ai-artificial-intelligence/987566/ai-civilizations-opeai-hugging-face-hack