Grok 4.7 深度解析:xAI 最新旗艦模型的價格、效能實測與程式開發能力全面評估

Grok 4.7 AI 模型視覺圖

Grok 4.7 是什麼?xAI 為什麼要在這個時間點推出新模型?

2026 年 9 月 21 日,Elon Musk 旗下的 xAI 正式發布了 Grok 4.7,定位為該公司目前最強大的旗艦 AI 模型。這個發布時間極具戰略意義:就在 Anthropic 發表 Claude Opus 5.5 和 OpenAI 推出 GPT-6 的前一天,xAI 選擇搶先一步亮相,試圖在這場 AI 模型混戰中先聲奪人。

Grok 4.7 的核心主張很明確:它是 xAI 迄今為止在程式開發和專業知識工作上表現最好的模型。相較於前代 Grok 4.6,4.7 在多個關鍵指標上都有顯著提升,同時維持了相同的 API 價格。這種「加量不加價」的策略,是 xAI 試圖在已經擁擠的 AI 市場中爭取開發者青睞的關鍵手段。

但 Grok 4.7 真的能跟 Claude 和 GPT-6 這些對手抗衡嗎?這篇文章將從規格、效能評測、API 定價、程式開發能力、安全性等多個面向,幫你做出客觀的判斷。

Grok 4.7 的核心規格與技術升級有哪些?

在深入評測之前,先掌握 Grok 4.7 的基本技術規格。以下幾個數字決定了它的應用邊界:

  • 上下文視窗:50 萬(500K)tokens,支援文字與圖片輸入,僅支援文字輸出
  • 輸出長度:無硬性上限,可以產生任意長度的回應
  • 推理努力控制:可設定為 low、medium、high(預設)、xhigh 四個等級
  • 基礎架構:相較於 Grok 4.6,使用了更大的基礎模型,並經過延長的強化學習訓練

核心規格

50 萬 tokens 上下文 / 無輸出長度限制 / 4 段推理努力控制 / 改進自我驗證機制

其中最值得關注的是「推理努力控制」功能。開發者可以根據任務的複雜度,動態調整模型投入的運算資源。簡單的分類任務用 low 模式快速處理,複雜的程式除錯用 xhigh 模式深度分析。這種靈活性在實際部署中能夠有效控制成本。

另一個重要的技術升級是自我驗證機制的改進。Grok 4.7 在執行多步驟的長時間任務時,會主動在中間步驟進行結果驗證,減少因為早期錯誤而導致後續步驟全部偏離的問題。這對於 Agentic 工作流程來說是一個關鍵的改進。

Grok 4.7 的效能評測表現如何?跟競品的差距有多大?

效能數字是每個開發者最想知道的答案。xAI 官方公布了一系列 benchmark 結果,同時第三方評測機構如 Artificial Analysis 也提供了獨立的對比數據。

xAI 官方公布的評測成績

評測項目 Grok 4.7 評測類型
CursorBench 4.0(程式碼品質) 46.3% 程式開發
DeepSWE v1.1(軟體工程) 71.0% 程式開發
EEBench(電子工程) 64.0% 專業知識
Harvey Legal Agent Benchmark(法律) 19.6% 專業知識
HealthBench Professional(醫療) 56.7% 專業知識

第三方獨立評測對比

第三方機構 Artificial Analysis 的獨立評測提供了更直觀的競品對比視角:

評測項目 Grok 4.7 Claude Fable 5.1 GPT-6 Astra
Intelligence Index(綜合智力) 46 53 53
Terminal-Bench 4.0(Agentic Coding) 26% 55% 60%

數字不會說謊,但也不能只看數字。幾個需要留意的重點:

第一,Grok 4.7 在 Artificial Analysis 的綜合智力指數上得到 46 分,而 Claude Fable 5.1 和 GPT-6 Astra 都是 53 分。這個差距在實際使用中是否有感,取決於你的具體任務類型。在日常的程式碼補全、文案生成等任務上,這個分差可能不太明顯;但在需要多步驟邏輯推理的複雜任務上,差距會被放大。

第二,Terminal-Bench 4.0 的分數差距比較大(26% vs 55%/60%),這是一個專門測試「多步驟自動化程式開發」能力的評測。Grok 4.7 在這個項目上落後較多,意味著如果你的主要用途是 Agentic Coding 工作流程,Claude 或 GPT-6 可能是更好的選擇。

第三,也是最公平的角度:Grok 4.7 的對比對象不應該只看最頂級的 Fable 5.1 和 GPT-6 Astra。如果拿同價位的模型來比較,Grok 4.7 的性價比其實相當有競爭力。

Grok 4.7 的 API 定價是多少?成本效益怎麼算?

xAI 這次選擇了「維持原價」的策略,Grok 4.7 的標準版定價與 Grok 4.6 完全相同。這意味著現有用戶可以免費獲得效能升級,不需要增加任何預算。

計費項目 標準版(200K 以下) 標準版(200K 以上) Fast 版
輸入(每百萬 tokens) $2.00 $4.00 $4.00
快取輸入(每百萬 tokens) $0.50 $1.00 $1.00
輸出(每百萬 tokens) $6.00 $12.00 $12.00

定價策略

標準版 $2.00/$6.00(200K 以下)/ 維持與 Grok 4.6 相同價格 / Fast 版速度 2 倍

幾個定價策略的解讀:

首先,200K tokens 的分界線設計得很巧妙。大多數普通的 API 呼叫(聊天、短文生成、分類等)的 prompt 長度都在 200K 以下,可以享受最低價格。只有處理大型程式碼庫或長篇文件時才會觸發較高的價位。

其次,Fast 版本提供 2 倍的輸出速度,但價格也是 2 倍。xAI 限制 Fast 版僅能透過 Cursor 和 Grok Build 使用,不開放在公開 API 中。這個策略顯然是為了將高價值的開發者用戶導向 xAI 自家的開發工具生態系統。

第三,與 Claude Opus 5.5 的定價比較。Opus 5.5 的標準輸入價格是每百萬 tokens $4.00,輸出是 $20.00。相比之下,Grok 4.7 的標準版輸入 $2.00、輸出 $6.00,在價格上有明顯優勢。但別忘了效能差距:如果一個任務用 Grok 需要多次重試,而用 Claude 一次就能完成,那最終的總成本可能反而更高。

Grok 4.7 的程式開發能力怎麼樣?適合用在什麼場景?

程式開發亮點

DeepSWE 71.0% / Cursor 深度整合 / 改進長任務自我驗證 / 文件自動生成

程式開發是 xAI 這次主打的核心優勢。Grok 4.7 在程式碼相關的應用場景上有幾個值得關注的改進:

Cursor 和 Grok Build 的深度整合

Grok 4.7 與 Cursor 開發環境進行了深度整合,開發者可以直接在 IDE 中使用 Grok 4.7 進行程式碼補全、重構和除錯。CursorBench 4.0 的 46.3% 分數雖然不是最高,但在日常的程式碼補全任務中已經能提供相當流暢的開發體驗。

Grok Build 則是 xAI 推出的 Agentic 程式開發平台,類似於 Claude 的 Agent 模式。開發者可以用自然語言描述需求,Grok 4.7 會自動規劃實作步驟、撰寫程式碼、執行測試並修正錯誤。

改進的自我驗證與長任務管理

前代 Grok 4.6 在處理長時間的多步驟任務時,容易出現「漂移」問題:隨著步驟增加,模型對最初需求的理解會逐漸偏移。Grok 4.7 透過改進的自我驗證機制來解決這個問題,在關鍵步驟之間會主動檢查中間結果是否符合預期。

DeepSWE 評測的亮眼表現

DeepSWE v1.1 是一個測試模型理解和修改真實開源軟體的能力的評測。Grok 4.7 在這個項目上取得了 71.0% 的成績,這是一個相當不錯的數字。它代表 Grok 4.7 有能力理解複雜的軟體架構,並在不破壞既有功能的前提下進行修改。

文件與簡報生成能力的提升

除了純程式碼任務之外,Grok 4.7 在文件生成方面也有改進。它能夠根據程式碼庫自動生成技術文件、API 說明、部署指南等。對於經常需要在「寫程式」和「寫文件」之間切換的工程師來說,這是一個實用的改進。

Grok 4.7 的安全性表現如何?

AI 安全是近期產業關注的焦點,xAI 在 Grok 4.7 上也投入了相當的心力。以下是幾個關鍵的安全指標:

  • 防護架構升級:Grok 4.7 配備了新的「safeguard stack」安全防護架構,用多層防護機制來過濾潛在的有害輸出。
  • 生物安全評測:在 LatchBio 的生物安全 benchmark 上取得 62.4% 的分數,這是目前公開報告中的最高成績之一。
  • 網路安全防護:在 xAI 自家的 HackerBench v0.3 測試中,成功阻擋了 96.7% 的危險雙重用途提示,同時保留了合法資安研究的使用彈性。

值得注意的是,xAI 在安全性方面的測試框架與 Anthropic 和 OpenAI 有所不同,三家公司各自使用不同的評測標準,因此直接比較安全分數意義不大。更重要的是關注每家公司在安全機制設計上的思路。

Anthropic 傾向於保守策略,對於潛在風險寧可誤殺也不放過;OpenAI 著重於建立可解釋的安全決策流程;xAI 則強調在安全與實用性之間取得平衡,特別是在資安研究等「合法但敏感」的使用場景上。

Grok 4.7 值得從 Grok 4.6 升級嗎?還是應該直接選 Claude 或 GPT-6?

這個問題的答案取決於你的具體需求和預算:

如果你已經在用 Grok 4.6:毫不猶豫地升級。價格完全相同,效能全面提升,沒有任何不升級的理由。API 切換也很簡單,只需要更改 model ID 即可。

如果你是新用戶,需要從零開始選擇:

  • 預算優先:Grok 4.7 的 $2/$6 定價(200K 以下)是目前旗艦模型中最低的,適合預算有限但需要旗艦等級能力的團隊。
  • 程式開發為主:如果你的核心需求是 Agentic Coding,Claude Opus 5.5 或 GPT-6 Astra 在 Terminal-Bench 上的表現明顯領先,但 Grok 4.7 在 DeepSWE 上的表現也相當不錯,實際體驗差距可能沒有 benchmark 數字暗示的那麼大。
  • 企業合規需求:如果你的企業對 AI 安全與合規有嚴格要求,Anthropic 的 Claude 系列在第三方獨立安全評估方面有更長的實績。
  • 已在 X/Twitter 生態圈:如果你的產品已經深度整合 X 平台的數據或服務,Grok 4.7 作為同生態系統的原生 AI 模型,整合成本會更低。

Grok 4.7 常見問題

Grok 4.7 可以在哪些平台上使用?

Grok 4.7 目前已上線以下平台,無需排隊等候:Cursor 開發環境、Grok Build(xAI 的 Agentic 開發平台)、xAI API(console.x.ai)、多個第三方程式開發工具和模型路由服務。

Grok 4.7 支援圖片輸入嗎?

支援。Grok 4.7 接受文字和圖片混合輸入,但輸出僅限文字。如果你需要圖片生成功能,需要搭配 xAI 的其他服務。

Fast 版和標準版有什麼差別?

Fast 版使用相同的 Grok 4.7 模型,但輸出速度快 2 倍,價格也是 2 倍。Fast 版目前僅能透過 Cursor 和 Grok Build 使用,不開放在公開 xAI API 中。

Grok 4.7 的推理努力控制怎麼設定?

透過 API 參數即可設定。提供 low、medium、high(預設)、xhigh 四個等級。建議根據任務複雜度動態調整:簡單分類用 low,複雜推理用 xhigh。不同等級的 token 消耗和回應時間差異顯著。

Grok 4.7 跟 Grok 4.6 的 API 可以無縫切換嗎?

可以。API 介面保持向後相容,只需要更新 model ID 即可。但建議在切換前先用測試數據驗證輸出品質,因為模型行為在某些邊界案例上可能有差異。

結論:Grok 4.7 的真正價值在於高性價比,而非追頂尖

總結 Grok 4.7 的整體表現,xAI 交出了一份務實的答卷。它不是目前市場上最強的 AI 模型,在多個關鍵 benchmark 上仍然落後於 Claude Fable 5.1 和 GPT-6 Astra。但如果把定價因素納入考量,Grok 4.7 提供了一個非常有競爭力的選項:用最低的旗艦模型價格,獲得足以應付大多數商業應用的效能。

對於台灣的開發者和企業來說,Grok 4.7 特別適合以下情境:已經在使用 Cursor 開發環境的團隊、需要控制 AI 支出但又不想犧牲太多效能的新創公司、以及想要在多個 AI 模型之間進行比較測試的技術團隊。

最終的建議依然不變:benchmark 數字只是參考,真正的決策依據應該來自你自己的使用場景測試。花半天時間用你的實際數據分別測試 Grok 4.7、Claude Opus 5.5 和 GPT-6,比看一百篇評測文章都更有價值。

企業 AI 模型選型需要專業建議?

台灣人工智慧網路 (Ai.com.tw) 提供 AI 顧問服務,協助企業評估不同 AI 模型的適用性,從技術架構、成本效益到安全合規,提供完整的導入規劃方案。