AI 人工智慧2026 年 9 月 22 日

「Gemini 4 Pro 偷偷上線了」是真的嗎?

有開發者在 AI 對戰平台 Arena 上遇到一個標示為 gemini-3.8-flash 的模型,覺得它強得不像 Flash 等級,於是傳出「Google 偷偷上線 Gemini 4 Pro、碾壓 GPT-6 Astra 和 Claude Fable 5.1」。但這裡有個很多人搞混的關鍵:Gemini 3.8 Flash 是 2026 年 9 月 2 日就正式發布的真實模型。這篇把傳聞規格、流傳跑分和 Google 官方實際說過的兩句話分開擺,附上影片整理,並給你三個五分鐘內判斷這類新聞真假的方法。

#Google Gemini #Gemini 4 Pro #Gemini 3.8 Flash #LM Arena #AI模型 #AI產業
「Gemini 4 Pro 偷偷上線了」是真的嗎? - AI 人工智慧

先給結論:到 2026 年 9 月 22 日為止,Google 沒有發布 Gemini 4 Pro,也沒有承認正在 Arena 上測試它。網路上在傳的是另一件事——有開發者在 AI 對戰測試平台 Arena 上遇到一個標示為 gemini-3.8-flash 的模型,覺得它強得不像 Flash 等級,於是猜「Google 是不是拿舊名字在偷測下一代」。Google 唯一公開講過的,是 7 月 21 日那句「已經開始至今最大規模的 Gemini 4 預訓練」。

TL;DR(懶人包):
① 傳聞起點:9 月 17、18 日前後,有開發者在 Arena 抽到標示 gemini-3.8-flash 的模型,表現明顯超出預期,被推測是 Gemini 4 Pro 的內部版本(傳言代號 Argon)。
② 很多人搞混的一點:Gemini 3.8 Flash 是真的、2026 年 9 月 2 日就正式發布的模型,官方優惠價每百萬 tokens 輸入 0.75 美金、輸出 3.75 美金(優惠 2026 年底到期)。「同一個名字卻強得不像」才是這則傳聞的起點。
③ 傳聞規格:1,000 萬 tokens 輸入、25.6 萬 tokens 輸出、跨對話持久記憶、定價 2.25/11.25 美金——全部沒有出處,而且不管對哪個官方價都剛好是整數倍,像算出來的。
④ 傳聞跑分:DeepSWE v1.1 88.7%、Terminal-bench 2.1 95.3%、OSWorld-2.0 86.8%,聲稱贏過 GPT-6 Astra 和 Claude Fable 5.1。但這幾個數字全部比 Google 官方成績表上任何一個模型都高一截;連原始中文報導自己都加了前提:「若這張表分數屬實」。
⑤ Google 官方只講過兩句:7/21 部落格說開始訓練 Gemini 4、7/22 財報電話上 Pichai 說下一步要靠更大的基礎模型,要補強的是寫程式和「代理式寫程式」。沒有上線日、沒有規格、沒有跑分。

這則新聞我看到三四個版本,標題一個比一個肯定:「已經上線」「碾壓對手」「Google 反超了」。但我把每個數字往回追,發現它們幾乎全部來自同一批網友的測試心得,不是任何官方文件。所以這篇我把「傳聞」和「官方講過的話」分開擺,每一條都附出處,你自己判斷。

一、事情是怎麼開始的

2026 年 9 月 17、18 日前後,有開發者在 Arena(讓兩個 AI 模型互相對打、由人投票比較的測試平台,模型名稱有時是匿名或代號)抽到一個標示 gemini-3.8-flash 的模型,然後開始在社群上貼它做出來的東西。

他們貼的主要是「做出來的成品」,不是文字回答:網頁設計、SVG 插畫、3D 建模、動畫、可以直接玩的小遊戲。被整理起來的示範包括一個有捲動繪製效果的素描風網站、一隻會騎腳踏車的鵜鶘、一座像素方塊寶塔、一架 Airbus H145 直升機模型、飛行模擬器,還有一款 3D 卡丁車賽車。貼出來的人不只一個,其中 Pankaj Kumar 在 X 上的心得被轉得最多,他的說法是 SVG 和 3D 生成進步很多、一次就給得出可用結果、指令跟隨也更聽話。

然後大家開始猜:這會不會是 Gemini 4 Pro?

關鍵是這個名字本來就有主人

這是整件事最容易被誤讀的地方,也是我覺得你只要記一件事就記這件:Gemini 3.8 Flash 不是虛構的名字,它是 Google 在 2026 年 9 月 2 日就正式發布的模型。

這件事有完整官方出處:Google 官方公告把它定位成「最聰明的主力型(workhorse)模型」,在軟體工程、代理任務和多步推理上比 3.7 Flash 明顯進步,價格延續前一代:每百萬 tokens 輸入 0.75 美金、輸出 3.75 美金。這裡補一句很多人沒注意的:這是優惠價,2026 年 12 月 31 日到期,2027 年 1 月 1 日起會變成輸入 1.5 美金、輸出 7.5 美金。後面講傳聞定價的時候會用到這組數字。同時還推出一個叫 Gemini 3.8 Flash Cyber 的變體,專門用來找和修軟體漏洞。9to5Google 和 The Register 當天都有報導。

Google 官方公布的 Gemini 3.8 Flash 評測成績表
圖:Google 官方發布 Gemini 3.8 Flash 時公布的成績表。這才是「正式版 3.8 Flash 有多強」的官方基準線。圖片來源:Google 官方部落格,版權屬 Google。

所以 Arena 上那個同名模型為什麼讓人起疑,邏輯是這樣:它掛著一個大家已經摸過、知道大概有多強的名字,但做出來的東西超出那個等級。就像一台掛著市售車型號的測試車,在賽道上跑出超越級別的成績,大家自然會猜引擎被換過。

但這裡要停一下:跑得快本身不能證明它的身分。也可能是同一顆模型在不同題目上表現落差大、可能是抽到不同版本的檢查點、也可能是測試者的題目剛好對它有利。這句話後面還會用到。

二、傳聞說了什麼(以下全部未經證實)

我把散在各篇報導裡的說法整理成一張表,右邊那欄是我自己的備註:

項目 傳聞說法 我的備註
身分 Gemini 4 Pro 的內部檢查點,代號 Argon 純推測,Google 沒證實過任何一個字
輸入上限 1,000 萬 tokens 沒有官方文件或 API 文件佐證
輸出上限 25.6 萬 tokens 同上
記憶 跨對話的持久記憶 同上,而且這是使用者端很難驗證的功能
定價 每百萬 tokens 輸入 2.25 美金、輸出 11.25 美金 不管對哪個官方價都是整數倍:優惠價的 3 倍、2027 年正式價的 1.5 倍。太剛好了,像推算的,不像抄到的
跑分 DeepSWE v1.1 88.7%、Terminal-bench 2.1 95.3%、OSWorld-2.0 86.8%,贏過 GPT-6 Astra 與 Claude Fable 5.1 來自一張在社群流傳的表。連數字本身都兜不攏:有的報導寫 88%,有的寫 88.7%。原始報導自己也寫了「若這張表分數屬實」
上線時間 社群猜 2026 年 10 月 Google 沒公布任何時程

「碾壓 GPT-6 Astra 和 Claude Fable 5.1」這句話,來源就是表裡那三個跑分。如果你想看官方公布的跑分長什麼樣子、跟這種流傳版本差在哪,可以對照我之前寫的 GPT-6 Astra 那篇——那邊每個數字都有 OpenAI 的官方出處,這邊的沒有。差別就在這裡。

把傳聞數字跟官方成績表擺在一起看

這段是你自己可以核對的。Google 發布 Gemini 3.8 Flash 的時候,公布了一張完整成績表,上面有它自己和幾個對手的分數(就是前面那張圖)。我把傳聞那組數字擺進去比:

評測項目 傳聞說 Gemini 4 Pro 拿到 Google 官方表上最高分
DeepSWE v1.1
長時程軟體工程
88.7% 74.0%(Claude Opus 5)
Gemini 3.8 Flash 是 73.7%
Terminal-bench 2.1
終端機裡的代理式寫程式
95.3% 89.4%
就是 Gemini 3.8 Flash 自己
OSWorld-2.0
自己操作電腦
86.8% 75.4%(Claude Opus 5)
Gemini 3.8 Flash 是 59.0%
GDPval-AA v2
知識工作,計分是 Elo
2064 1824(Claude Opus 5)
Gemini 3.8 Flash 是 1545

四項全部高出一截,DeepSWE 那項更是比表上最強的模型再高快 15 個百分點。這不代表它一定是假的,新一代模型本來就會往上跳。但跳這麼多還安安靜靜掛在一個 Flash 的名字底下,不太合理——真有這種成績,Google 自己會開記者會講。這是我覺得最該存疑的地方。

還有一個更大的猜想:AI 幫忙改進 AI

報導後半段還加了一層:RSI(recursive self-improvement,遞迴自我改進)。白話講就是讓 AI 參與設計和訓練下一代 AI,下一代變強之後再回頭幫忙改更多,像滾雪球。文章把 Gemini 的進展跟這個概念連起來,暗示 Google 已經靠這套加速做完 Gemini 4。

這一段完全是推論。RSI 在 AI 研究裡是真實存在的方向,但「Google 已經用它做出 Gemini 4」目前沒有任何官方說明或技術文件支持。這是傳聞裡我覺得最該打問號的部分,因為它最好聽、也最難查。

三、影片

影片來源:Sketched Truths 的 YouTube 頻道(第三方整理,非 Google 官方)。

四、Google 官方實際上說過的話

這部分出處明確,而且就只有兩件事。

一、2026 年 7 月 21 日:官方確認已經開始訓練 Gemini 4。就在發布 Gemini 3.6 Flash、3.5 Flash-Lite、3.5 Flash Cyber 的那篇公告結尾,Gemini 團隊寫了一句:「We have started our most ambitious pre-training run yet, for Gemini 4, and are excited by the progress.」(我們已經開始至今最大規模的預訓練,目標是 Gemini 4,對進度感到興奮。)在訓練途中就對外講這種話,在 Google 身上不太常見,所以當時就被注意到了。

二、2026 年 7 月 22 日:Pichai 在第二季財報電話裡講了方向。他說下一步要靠「更大的基礎模型」(much larger base models),而且點名要補強的是寫程式和「代理式寫程式」(agentic coding)——也就是讓 AI 自己動手寫、自己跑完,不是泛指什麼都能自己做的萬用代理。這段是財報電話上的發言,Alphabet 官方當天的財報貼文可以對日期,發言細節見現場報導。

Google 官方公布的 Gemini 3.8 Flash DeepSWE 評測成績
圖:Google 官方公布的 Gemini 3.8 Flash DeepSWE v1.1 成績(橫軸是每題平均花多少錢)。整張圖最高的是 Claude Opus 5 的 74.0%,Gemini 3.8 Flash 自己是 73.7%。傳聞那張表聲稱 88.7%,比圖上任何一個模型都高快 15 個百分點。圖片來源:Google 官方部落格,版權屬 Google。

就這樣。沒有上線日期、沒有規格、沒有跑分,也沒有任何一句話證實 Arena 上那個模型是 Gemini 4 Pro。「正在研發」有官方依據;「已經上線、而且全面贏過對手」目前還不能當定論。

五、下次看到這種新聞,我會做的三件事

「某模型偷偷上線、碾壓全場」這種新聞幾乎每個月都有。我自己養成三個動作,加起來不到五分鐘:

  1. 先問一句:這是誰說的?同一件事,離當事人越近的來源越可信。最可信的是當事公司自己發的東西——官方部落格、API 文件、財報電話,因為講錯要負責。中間是記者採訪,記者至少去問過人、掛自己的名字。最鬆的是網友的使用心得,可能很準,但沒人為它背書。用這把尺量這則新聞:「Google 開始訓練 Gemini 4」是 Google 自己在部落格寫的;其他全部——匿名模型的身分、規格、跑分、代號——都停在網友心得那一層。
  2. 看跑分表有沒有出處。官方發布的跑分會標評測名稱、版本和測試設定,社群流傳的表通常只有一排數字。只有數字就先當沒看到——這則報導自己都寫了「若分數屬實」,等於作者也知道。
  3. 把標題和內文對一遍。「已經上線」對應的內文其實是「有人在測試平台遇到」;「碾壓」對應的是「一張未經證實的表」。標題比內文肯定,是最常見的放大方式,而且不需要造假就能做到。

我不是說這則傳聞是假的。Google 在訓練 Gemini 4 是真的,10 月發表也完全有可能,之後回頭看說不定大部分都對。我想講的只是:現在拿它去改工作流程或做決策,太早。

六、那這跟做內容、做生意的我們有什麼關係

兩件實際的事。

第一,不要為了還沒上線的模型改流程。我看過有人因為傳聞說「輸入上限要變 1,000 萬 tokens」,就先停下手上整理資料的流程等新模型。結果等了兩個月,工作沒進度。我的做法是:新模型真的上線之後,拿一個「真的要交付」的小案子跑一次再決定要不要換。撐得過一次真實交付的,才值得花時間學。我平常實際在用、撐得住交付的工具都整理在 Zeona 工具箱,可以直接拿去用。

第二,這種新聞會被 AI 搜尋大量引用,而它引用誰是有邏輯的。同一則傳聞,ChatGPT、Perplexity 這些工具傾向引用那些把「官方說過什麼/沒說過什麼」分得很清楚的頁面,因為結構清楚、好擷取,引錯的風險也低。如果你在做內容,想搞懂這套邏輯怎麼運作,可以看我寫的 GEO 生成式引擎優化完整指南,還有一篇實際做出成效的案例拆解。

常見問題 FAQ

Q1:所以 Gemini 4 Pro 到底上線了沒?

沒有。截至 2026 年 9 月 22 日,Google 沒有發布 Gemini 4 Pro,也沒有公布任何時程。唯一的官方訊息是 7 月 21 日確認「已經開始 Gemini 4 的預訓練」。社群在猜 10 月,但那是猜的。

Q2:那我在 Arena 上遇到的 gemini-3.8-flash 是什麼?

最可能就是正式版的 Gemini 3.8 Flash,它 9 月 2 日已經公開發布。傳聞認為其中某些對話是 Google 拿這個標籤在測更強的模型,但這沒有得到證實,也沒辦法從使用者端驗證——你看到的只有模型名稱和回答,看不到後面掛的是哪個檢查點。

Q3:Gemini 3.8 Flash 和傳聞中的 Gemini 4 Pro 差在哪?

一個是已經發生的事實,一個是還沒發生的傳聞。Gemini 3.8 Flash 是 9 月 2 日正式發布的主力型模型,官方優惠價每百萬 tokens 輸入 0.75 美金、輸出 3.75 美金(2026 年底到期,之後是 1.5/7.5),還有一個專門找軟體漏洞的 Cyber 變體。Gemini 4 Pro 目前只有「正在訓練」這一句官方說明,連完整名稱都還沒被 Google 用過。

Q4:那些 1,000 萬 tokens、跨對話記憶的規格可信嗎?

目前不可信,因為沒有出處。這些數字全部來自社群流傳的整理,不是官方文件也不是 API 文件。一個可以自己檢查的線索:傳聞定價不管對哪個官方價都是整數倍。對優惠價(0.75/3.75)剛好 3 倍,對 2027 年起的正式價(1.5/7.5)剛好 1.5 倍。太剛好了,比較像有人照 Pro 等級推算出來的,不像從真實價目表抄到的。

Q5:RSI(遞迴自我改進)是什麼?Google 真的在用嗎?

RSI 指的是讓 AI 參與改良下一代 AI,下一代變強後再幫忙改更多。這在 AI 領域是真實存在的研究方向,但「Google 已經靠 RSI 完成 Gemini 4」是報導的推論,沒有官方說明或技術文件支持。這是整則傳聞裡我覺得最該打折扣的部分。

資料來源

傳聞報導(未經官方證實):
· 英文原文起點:Futu News(頁面需 JavaScript 才顯示內文)
· 中文轉載(新智元):華爾街見聞
· Dataconomy、OfficeChai、atoms.dev 的示範整理
· 開發者心得:@pankajkumar_dev on X
· 影片整理:Sketched Truths on YouTube

官方來源:
· Gemini 3.8 Flash 與 3.8 Flash Cyber 發布公告(2026/9/2,含定價與評測圖表)
· Gemini 3.6 Flash 等模型公告(2026/7/21,文末即 Gemini 4 預訓練那句)
· Alphabet 2026 第二季財報貼文(2026/7/22)與財報電話發言報導
· 正式版 3.8 Flash 報導:9to5Google、The Register

本文內文圖表與封面圖皆取自 Google 官方部落格,版權屬 Google;嵌入影片版權屬原 YouTube 頻道。

如果你想聊聊該怎麼判斷一個新 AI 工具值不值得納進工作流程,或需要有人幫你把內容和網站的 AI 搜尋能見度做起來,歡迎直接找我聊。

#Google Gemini #Gemini 4 Pro #Gemini 3.8 Flash #LM Arena #AI模型 #AI產業

推薦閱讀

Tesla 無人計程車上路一週就出包:大晴天開雨刷、停在路中間放人 - AI 人工智慧
AI 人工智慧
2026 年 9 月 21 日

Tesla 無人計程車上路一週就出包:大晴天開雨刷、停在路中間放人

這台車沒有方向盤,也沒有踏板。2026 年 9 月在德州奧斯汀開始收費載客後,乘客陸續拍到它的異常行為,還在螢幕裡翻出一支隱藏的虛擬搖桿,NHTSA 已對 Tesla 的自我認證流程開案調查。但同一週更值得看的是另外三件事:小鵬開了人形機器人量產線、Agility 公開報出 1.1 年回本、宇樹股價從高點腰斬。這篇把 The Rundown AI 那期電子報完整拆給你看,每個數字都附原始出處。

OpenAI發布GPT-6 Astra:能自己操作電腦、獨立跑完一整天工作任務,對創作者與小商家的意義 - AI 人工智慧
AI 人工智慧
2026 年 9 月 8 日

OpenAI發布GPT-6 Astra:能自己操作電腦、獨立跑完一整天工作任務,對創作者與小商家的意義

OpenAI於2026年9月4日發布GPT-6 Astra,這顆推理模型能操作電腦介面、長時間獨立完成任務,電腦使用能力(OSWorld 2.0)達72.6%、任務耗時砍半。整理它的關鍵數據、與前代GPT-5.6 Sol的差異、定價與釋出時程,並分析對創作者與小商家的實際影響,附3個現在就能做的準備動作。

2026和泰AI黑客松開放報名:總獎金破百萬,用AI解決TOYOTA真實企業題目 - AI 人工智慧
AI 人工智慧
2026 年 9 月 4 日

2026和泰AI黑客松開放報名:總獎金破百萬,用AI解決TOYOTA真實企業題目

和泰集團主辦的2026 AI黑客松開放報名,主題「以AI為核心動力,讓創意成為可落地的解決方案」,本屆開出7道企業挑戰題目(含TOYOTA油轉電挑戰),總獎金超過100萬元。整理參賽資格、賽制評分標準、獎勵辦法,還有報名連結。

需要專業的數位服務嗎?

從即套即用的數位工具箱,到客製化軟體開發與 AI 系統串接,Zeona 都能幫你。

立即聯繫