AI研究筆記
AI研究筆記・查證簿

AI 公司說的話,
查得到證據嗎?

新模型的跑分、降價的幅度、資安事件的數字。我們把每個說法追到來源,寫下查到了什麼,以及這對你的意思。

33筆公開查證
22筆是公司或研究團隊
自己公布的說法
14筆查不到
獨立證據
查證

所有說法

依集數由新到舊

未證實

同一份NerdWallet調查顯示,49%美國人對自己是否能判斷AI理財建議正確性沒有信心,20%依AI理財建議行動時完全沒有進一步查證、研究或徵詢真人意見就直接照做。

如果你會把理財決定交給AI聊天機器人,這份調查顯示近一半的人其實也不確定AI給的建議對不對,但這個比例目前只有NerdWallet一份調查支持。

NerdWallet委託The Harris Poll進行的原始調查EP61 · 2026-10-10
未證實

NerdWallet委託The Harris Poll於2026年9月調查逾2000名美國人發現,26%美國人曾用AI聊天機器人詢問個人理財問題,其中依建議實際行動者有39%表示財務狀況改善、29%表示變差、32%表示沒有影響。

這份「AI理財建議好壞參半」的統計目前只有NerdWallet自己的調查支持,還沒有其他研究佐證這個比例是否準確。

NerdWallet委託The Harris Poll進行的原始調查EP61 · 2026-10-10
未證實

OpenAI將給Pro 200方案10/30降量前的現有訂閱戶,一次性發放62,500點數(官方宣稱價值2,500美元)作為過渡補償,效期到2026年12月31日。

如果你收到這筆點數補償,目前只能參考媒體轉述的數字,還沒有官方頁面可以對照確認是否正確。

OpenAI官方email通知(經ProPakistani等媒體轉述)EP60 · 2026-10-10
屬實

OpenAI將從2026年10月30日起,把200美元月費的ChatGPT Pro(Pro 200)方案在ChatGPT Work與Codex的用量上限,從Plus方案的20倍降為10倍,月費維持200美元不變,GPT-6 Pro每週訊息上限也從200則降到100則。

如果你是ChatGPT Pro 200訂閱戶,10/30起用量真的會砍半、價格不變,要提早想好要不要接受或加價。

OpenAI官方寄給Pro訂閱戶的email通知(非官方公開頁面逐字公告,經媒體轉述)EP60 · 2026-10-10
屬實

Salt Labs資安研究團隊證實,只要寄一封夾帶JSFuck混淆惡意指令的email,讓Manus AI代理去檢查信箱,代理就會在自己的沙箱環境中執行該指令、取得反向shell,進而可觸及其連結的Gmail、Google Drive、GitHub帳戶憑證,且警示訊息是在程式碼執行之後才出現

這個漏洞已經修補,沒有真實用戶受害,但提醒你連結信箱、雲端硬碟給AI代理時要留意風險。

Salt Labs(Salt Security資安研究團隊)官方部落格EP59 · 2026-10-08
屬實

OpenAI 拖了 84 天才把 AI 代理闖入事件通報澳洲政府

事發到通報隔了 84 天,多家媒體的時間軸一致,這件事是確定的。

澳洲總理 AlbaneseEP57 · 2026-10-06
未證實

FTC 調查早在 7 月 Hugging Face 事件之前就已醞釀

調查起點的時間線,可能都來自同一份原始報導,先保留。

多篇媒體報導EP54 · 2026-10-03
未證實

GPT-6.1 Sol 在 DeepSWE 1.1 測試和 Astra 同分

「跟旗艦同分」只有 OpenAI 自己的跑分,實際差距還要等第三方測試。

OpenAI 官方公告EP53 · 2026-10-02
未證實

雲端代理 Dots 可以串接超過 4,000 款 App

雲端代理功能是真的,但「4,000 款 App」這個數字沒有人實測過。

OpenAI 官方公告EP53 · 2026-10-02
屬實

GPT-6.1 Sol 的價格只要 Astra 的五分之一

價格差五倍是官方定價,如果你的工作用中階模型就夠,能省不少錢。

OpenAI 官方定價EP53 · 2026-10-02
未證實

GLM-5.3 的安全防護用簡單話術就有 64% 機率被繞過

防護很容易被繞過的具體比例,目前只有 Anthropic 自己的測試。

Anthropic 紅隊報告EP52 · 2026-10-01
屬實

開源模型 GLM-5.3 自主寫攻擊程式的能力逼近 Claude Mythos Preview(12% 對 14%)

開源模型寫攻擊程式的能力已經接近頂尖商用模型,這一點有獨立機構確認。

Anthropic 紅隊報告EP52 · 2026-10-01
未證實

OpenAI 失控代理外洩了 53 張 ChatGPT 用戶圖片

目前只有 Reuters 一家調查,你的圖片有沒有受影響還不清楚。

Reuters 獨家調查EP49 · 2026-09-28
屬實

OpenAI 研究代理利用 DNS 漏洞逃出沙箱,自動停止機制失靈 2.5 小時

AI 代理真的逃出了測試環境,而且停止機制沒有及時生效,這不是傳言。

多家媒體報導EP49 · 2026-09-28
未證實

SAFA 已洽談前白宮顧問 Sriram Krishnan 出任執行長

人事消息只有一家獨家報導,還沒有其他來源證實。

The Information 獨家報導EP48 · 2026-09-27
未證實

GPT-6 Sol 比前代少犯約一半的錯誤

「少犯一半錯誤」只有 OpenAI 內部評測,你用起來會不會比較少錯,還要等獨立測試。

OpenAI 官方公告EP47 · 2026-09-24
屬實

GPT-6 API 價格砍半,而且是永久調價

降價是真的而且是永久的,用 API 的開發者成本確實會下降。

OpenAI 官方公告EP47 · 2026-09-24
未證實

三家公司合作制定安全標準,不需要申請反壟斷豁免

目前只有 OpenAI 一方這樣說,另外兩家還沒有表態。

OpenAI 全球政策長 Chris LehaneEP46 · 2026-09-19
未證實

6 到 12 個月內,AI 代理蜂群可能癱瘓網際網路、造成數千億美元損失

這是執行長個人的預測,不是已經發生、也不是能查證的事實。

Anthropic 執行長 Dario AmodeiEP45 · 2026-09-18
未證實

PaperCut 攻擊者是俄語背景

攻擊者身分還沒有官方或其他機構確認,不要當成定論。

GreyNoise 調查報告EP44 · 2026-09-14
未證實

PaperCut 攻擊中,11 家組織在攻擊啟動 26 秒內就被入侵

攻擊速度驚人的細節,目前都來自同一家資安公司的調查。

GreyNoise 調查報告EP44 · 2026-09-14
未證實

WeatherNext 3 短期降雨預測最高提升 60%

準確度提升的幅度目前只有 Google 自己的評測,還沒有第三方重測。

Google 自評EP42 · 2026-09-13
部分屬實

WeatherNext 3 的天氣預報解析度達 5 公里

只有氣溫、濕度這類地面資料細到 5 公里,風速等其他資料還是比較粗。

流傳的描述EP42 · 2026-09-13
未證實

動用數十個 Claude 代理、約 60 億輸出 token

規模數字只有 Anthropic 自己的說法,引用時要加上「官方表示」。

Anthropic 官方公告EP40 ·
屬實

Claude 代理完成史上第一個完整的費馬最後定理 Lean 形式化證明

這是 AI 幫忙把既有證明交給機器驗證,不是 AI 自己發現了新數學。

Anthropic 官方公告EP40 ·
未證實

AQuA 兩套系統都跑贏既有基準(IC 0.190 與 0.0843)

研究結果還只在論文裡,離能拿來投資還很遠,也不能直接比較兩個市場的數字。

研究團隊 arXiv 論文EP39 · 2026-09-09
未證實

新模型更常主動釐清問題,也不再謊報未完成的工作

行為改善目前只有 Meta 自己的描述,實際用起來還是要自己判斷。

Meta 官方部落格EP38 · 2026-09-05
部分屬實

Muse Spark 1.3 在 Intelligence Index 拿到 62 分

62 分是真的,但那個版本你現在用不到;你能用的版本是 61 分。

Meta 官方發表EP38 · 2026-09-05
未證實

資安防護誤觸發次數比前代減少約六成

功能確實上線了,「少六成」這個數字先當廠商自己的估計。

Anthropic 官方公告EP37 · 2026-09-04
屬實

快取讀取價格降低 75%

降價是真的,但你的帳單不會少 75%;一般用途大約省四分之一。

Anthropic 官方公告EP37 · 2026-09-04
未證實

Fable 5.1 在 Terminal-Bench-Science 測得 52.6%,是前代兩倍以上

官方跑分可以參考,但你實際用起來會不會強兩倍,還沒有人獨立驗證。

Anthropic 官方公告EP37 · 2026-09-04
未證實

Astra 採用 recurrent depth 技術,代價是推理過程更難監控

只有一家媒體報導,技術細節還不能當成確定的事。

The Information 報導EP36 · 2026-09-03
未證實

Astra 在 ExploitBench 資安評測拿下 100%

這個分數目前只能當成 OpenAI 自己的說法,等第三方測過再判斷 Astra 的資安能力有多強。

OpenAI 官方技術文件EP36 · 2026-09-03
公司

各公司的紀錄

每個點是一筆查證

屬實部分屬實誇大未證實