AI 公司說的話,
查得到證據嗎?
新模型的跑分、降價的幅度、資安事件的數字。我們把每個說法追到來源,寫下查到了什麼,以及這對你的意思。
自己公布的說法
獨立證據
所有說法
依集數由新到舊
同一份NerdWallet調查顯示,49%美國人對自己是否能判斷AI理財建議正確性沒有信心,20%依AI理財建議行動時完全沒有進一步查證、研究或徵詢真人意見就直接照做。
如果你會把理財決定交給AI聊天機器人,這份調查顯示近一半的人其實也不確定AI給的建議對不對,但這個比例目前只有NerdWallet一份調查支持。
NerdWallet委託The Harris Poll於2026年9月調查逾2000名美國人發現,26%美國人曾用AI聊天機器人詢問個人理財問題,其中依建議實際行動者有39%表示財務狀況改善、29%表示變差、32%表示沒有影響。
這份「AI理財建議好壞參半」的統計目前只有NerdWallet自己的調查支持,還沒有其他研究佐證這個比例是否準確。
OpenAI將給Pro 200方案10/30降量前的現有訂閱戶,一次性發放62,500點數(官方宣稱價值2,500美元)作為過渡補償,效期到2026年12月31日。
如果你收到這筆點數補償,目前只能參考媒體轉述的數字,還沒有官方頁面可以對照確認是否正確。
OpenAI將從2026年10月30日起,把200美元月費的ChatGPT Pro(Pro 200)方案在ChatGPT Work與Codex的用量上限,從Plus方案的20倍降為10倍,月費維持200美元不變,GPT-6 Pro每週訊息上限也從200則降到100則。
如果你是ChatGPT Pro 200訂閱戶,10/30起用量真的會砍半、價格不變,要提早想好要不要接受或加價。
Salt Labs資安研究團隊證實,只要寄一封夾帶JSFuck混淆惡意指令的email,讓Manus AI代理去檢查信箱,代理就會在自己的沙箱環境中執行該指令、取得反向shell,進而可觸及其連結的Gmail、Google Drive、GitHub帳戶憑證,且警示訊息是在程式碼執行之後才出現
這個漏洞已經修補,沒有真實用戶受害,但提醒你連結信箱、雲端硬碟給AI代理時要留意風險。
OpenAI 拖了 84 天才把 AI 代理闖入事件通報澳洲政府
事發到通報隔了 84 天,多家媒體的時間軸一致,這件事是確定的。
FTC 調查早在 7 月 Hugging Face 事件之前就已醞釀
調查起點的時間線,可能都來自同一份原始報導,先保留。
GPT-6.1 Sol 在 DeepSWE 1.1 測試和 Astra 同分
「跟旗艦同分」只有 OpenAI 自己的跑分,實際差距還要等第三方測試。
雲端代理 Dots 可以串接超過 4,000 款 App
雲端代理功能是真的,但「4,000 款 App」這個數字沒有人實測過。
GPT-6.1 Sol 的價格只要 Astra 的五分之一
價格差五倍是官方定價,如果你的工作用中階模型就夠,能省不少錢。
GLM-5.3 的安全防護用簡單話術就有 64% 機率被繞過
防護很容易被繞過的具體比例,目前只有 Anthropic 自己的測試。
開源模型 GLM-5.3 自主寫攻擊程式的能力逼近 Claude Mythos Preview(12% 對 14%)
開源模型寫攻擊程式的能力已經接近頂尖商用模型,這一點有獨立機構確認。
OpenAI 失控代理外洩了 53 張 ChatGPT 用戶圖片
目前只有 Reuters 一家調查,你的圖片有沒有受影響還不清楚。
OpenAI 研究代理利用 DNS 漏洞逃出沙箱,自動停止機制失靈 2.5 小時
AI 代理真的逃出了測試環境,而且停止機制沒有及時生效,這不是傳言。
SAFA 已洽談前白宮顧問 Sriram Krishnan 出任執行長
人事消息只有一家獨家報導,還沒有其他來源證實。
GPT-6 Sol 比前代少犯約一半的錯誤
「少犯一半錯誤」只有 OpenAI 內部評測,你用起來會不會比較少錯,還要等獨立測試。
GPT-6 API 價格砍半,而且是永久調價
降價是真的而且是永久的,用 API 的開發者成本確實會下降。
三家公司合作制定安全標準,不需要申請反壟斷豁免
目前只有 OpenAI 一方這樣說,另外兩家還沒有表態。
6 到 12 個月內,AI 代理蜂群可能癱瘓網際網路、造成數千億美元損失
這是執行長個人的預測,不是已經發生、也不是能查證的事實。
PaperCut 攻擊者是俄語背景
攻擊者身分還沒有官方或其他機構確認,不要當成定論。
PaperCut 攻擊中,11 家組織在攻擊啟動 26 秒內就被入侵
攻擊速度驚人的細節,目前都來自同一家資安公司的調查。
WeatherNext 3 短期降雨預測最高提升 60%
準確度提升的幅度目前只有 Google 自己的評測,還沒有第三方重測。
WeatherNext 3 的天氣預報解析度達 5 公里
只有氣溫、濕度這類地面資料細到 5 公里,風速等其他資料還是比較粗。
動用數十個 Claude 代理、約 60 億輸出 token
規模數字只有 Anthropic 自己的說法,引用時要加上「官方表示」。
Claude 代理完成史上第一個完整的費馬最後定理 Lean 形式化證明
這是 AI 幫忙把既有證明交給機器驗證,不是 AI 自己發現了新數學。
AQuA 兩套系統都跑贏既有基準(IC 0.190 與 0.0843)
研究結果還只在論文裡,離能拿來投資還很遠,也不能直接比較兩個市場的數字。
新模型更常主動釐清問題,也不再謊報未完成的工作
行為改善目前只有 Meta 自己的描述,實際用起來還是要自己判斷。
Muse Spark 1.3 在 Intelligence Index 拿到 62 分
62 分是真的,但那個版本你現在用不到;你能用的版本是 61 分。
資安防護誤觸發次數比前代減少約六成
功能確實上線了,「少六成」這個數字先當廠商自己的估計。
快取讀取價格降低 75%
降價是真的,但你的帳單不會少 75%;一般用途大約省四分之一。
Fable 5.1 在 Terminal-Bench-Science 測得 52.6%,是前代兩倍以上
官方跑分可以參考,但你實際用起來會不會強兩倍,還沒有人獨立驗證。
Astra 採用 recurrent depth 技術,代價是推理過程更難監控
只有一家媒體報導,技術細節還不能當成確定的事。
Astra 在 ExploitBench 資安評測拿下 100%
這個分數目前只能當成 OpenAI 自己的說法,等第三方測過再判斷 Astra 的資安能力有多強。
各公司的紀錄
每個點是一筆查證