AI研究筆記
實測排行

同樣的工作,
各家 AI 做得怎樣?

每週一自動重跑。最新一次:2026-10-11,4 個模型、5 項工作。
快速回答 · 2026-10-11 實測

2026-10-11 的實測中,Gemini 3.8 Flash 在 5 項常見工作(會議紀錄、客訴回信、Excel 公式、英文報告摘要、簡報大綱)通過 25/25 項檢查,表現最好,每月成本約 NT$77。最便宜的是 OpenAI gpt-oss-120b,每月約 NT$11,通過 24/25 項。出錯最多的是:漏掉原文的數字或日期(3 次)、回覆客訴信時違反規定,主動提出退款(2 次)。

結果

這一次的排名

依通過率排序,同分時便宜的在前面

模型檢查項目通過每月成本平均回覆時間整理會議紀錄回覆客訴信寫 Excel 公式英文報告摘要改簡報大綱
Gemini 3.8 Flash25/25NT$7721 秒✓✓✓✓✓
OpenAI gpt-oss-120b24/25NT$119 秒✓✗ 違反規定,主動提出退款✓✓✓
Qwen 3.8 27B24/25NT$10955 秒✓✓✓✗ 漏掉2027年7月✓
Gemini 3.5 Flash-Lite22/25NT$142 秒✓✗ 違反規定,主動提出退款✓✗ 漏掉420人、漏掉9%✓
整理會議紀錄

整理會議紀錄:哪個 AI 做得好?

把會議逐字稿整理成決議、待辦(含負責人與期限)、未決事項

回覆客訴信

回覆客訴信:哪個 AI 做得好?

照公司規定回覆客人的抱怨信,不亂承諾補償

寫 Excel 公式

寫 Excel 公式:哪個 AI 做得好?

寫出「某人某月業績總和」這類條件加總公式

英文報告摘要

英文報告摘要:哪個 AI 做得好?

把英文報告摘要成中文重點,數字一個不漏

改簡報大綱

改簡報大綱:哪個 AI 做得好?

把雜亂的筆記整理成給老闆看的簡報大綱

怎麼測

測試方法

5 項固定工作(會議紀錄、客訴回信、Excel 公式、英文報告摘要、簡報大綱),每次都用同一組題目,才能比較前後變化。題目是我們自擬的情境,不是真實公司或人物。每個模型每項工作跑一次,由程式逐項檢查:該寫的有沒有寫到、數字有沒有保留、有沒有違反規定。

這些模型跟你用的 App 有什麼關係?Gemini 3.8 Flash、Gemini 3.5 Flash-Lite 是 Google Gemini 家族的模型,Gemini App 裡實際用哪個版本由 Google 決定;gpt-oss-120b 是 OpenAI 公開權重的模型,不是 ChatGPT App 裡用的模型;Qwen 是阿里巴巴的開源模型。我們用 API 直接測模型本身,結果可以當作挑工具、挑方案的參考。

「每月成本」是假設每項工作每個月做 100 次,用官方公告價格換算(匯率 32.0)。免費額度內使用不用付錢,這裡算的是超過免費額度後的價格。

  • gemini-3.8-flash:每百萬 token(AI 計算文字量的單位)輸入 US$0.75、輸出 US$3.75(ai.google.dev/gemini-api/docs/pricing (2027-01-01起調為1.50/7.50))
  • gemini-3.5-flash-lite:每百萬 token(AI 計算文字量的單位)輸入 US$0.3、輸出 US$2.5(ai.google.dev/gemini-api/docs/pricing)
  • gpt-oss-120b:每百萬 token(AI 計算文字量的單位)輸入 US$0.35、輸出 US$0.75(developers.cloudflare.com/workers-ai/platform/pricing)
  • qwen3.8-27b:每百萬 token(AI 計算文字量的單位)輸入 US$0.45、輸出 US$3.2(developers.cloudflare.com/workers-ai/platform/pricing)

這 5 項工作用的提示詞,訂閱週報就能免費拿到:訂閱並領取「AI 實測提示詞包」。