三大人工智能服務同時故障,原因仍未明
探討9月3日人工智能服務中斷的原因

ChatGPT、Claude和Grok於美國東部時間9月3日先後在大約同一小時內停止運作。這個時間上的巧合,乍看之下像是證明人工智能的核心基礎設施是一個脆弱、共享的系統—但現有證據並不支持這種說法。
同一小時出事,故障源頭各異
幾乎同時發生的服務中斷,很容易令人以為背後有同一個根本原因,例如互聯網基礎設施的某個環節同時故障。不過,至今沒有任何一家公司證實這一點。OpenAI表示,其服務中斷源於內部路由錯誤;Anthropic則指Claude.ai、Claude Code、Claude Cowork及其API出現基礎設施問題。xAI在服務狀態頁面承認Grok出現問題,但沒有交代原因。一份業界分析指出,沒有公開證據顯示AWS、Azure或Cloudflare曾發生足以同時解釋三宗事故的大規模故障。
「路由錯誤」究竟是甚麼?
這並不代表人工智能模型突然變得更差。路由錯誤是指負責把用戶請求導向適當伺服器的內部系統出現故障—就像交通調度員突然失去路線圖。出問題的不是人工智能本身,而是負責把服務送到用戶面前的周邊系統。
故障持續時間未完全吻合
不同媒體對服務中斷持續多久的報道並不一致,因此較穩妥的說法是,服務完全恢復前大約持續了三至四小時。Downdetector記錄到,美國在事故期間出現數以萬計與ChatGPT相關的錯誤報告。Google的Gemini在大約同一時間亦錄得用戶回報錯誤增加,但Google並未確認自身發生服務中斷。據報道,依賴Grok及Claude底層模型的Cursor亦受到下游影響。
披上模式外衣的巧合
三家公司在同一小時內相繼出現問題,看起來就像骨牌效應。但證據實際顯示的情況,更接近三宗獨立事故恰好在同一個60分鐘時段發生,而不是由同一個原因同時觸發。對於押注人工智能服務可如穩定公用事業般持續運作的人而言,這個區別相當重要。
目前仍未解答的問題是:三家公司均未發表事後檢討報告,指明一個確切原因。在OpenAI、Anthropic或xAI公布正式事故報告前,9月3日的事件究竟是巧合,還是涉及某個未被揭露的共享依賴,仍無法確認。
© Copyright IBTimes {{Year}}. All rights reserved.





















