Step 5 Preview 評測:價格、API、開放權重與 NSFW 限制
比較 Step 5 Preview 的 API 價格、實務表現與前代改良,說明開放權重時程、本機記憶體需求估算、推薦用途及 NSFW 限制。
Step 5 Preview 適合拿來測試需要處理程式碼、文件和試算表的複雜工作。它的吸引力是長上下文、多模態輸入,以及相對低的 API 單價;真正值得升級的情境,是較便宜的模型反覆失敗、無法交付成果的任務。
我們的結論:值得試用,但不宜直接稱為已公開的開源模型。 官方預計於 2026 年 10 月 15 日開放權重。此外,低單價不保證總費用最低:獨立測試發現,它相較 Step 3.7 Flash 進步明顯,但部分競品完成相同工作時更快、更省。
Step 5 Preview 是什麼?已經開源了嗎?
StepFun 將它定位為面向代理式工作的旗艦模型。官方公布的 MoE 架構共有 600B 參數,每個 token 啟用 27B。10 月 15 日是預定的權重公開日期;在正式檔案與授權條款出現前,應稱為「計畫開放權重」,不能推論為無限制的開源授權。官方公告

| 項目 | 官方規格 |
|---|---|
| 直接 API 模型 ID | step-5-preview |
| 上下文/最大輸出 | 100 萬/64K tokens |
| 輸入/輸出 | 文字、圖片、影片/文字 |
| 推理強度 | low、medium、high |
| 開發功能 | 工具呼叫、串流、JSON Mode、JSON Schema、提示快取 |
官方文件明確列出影片輸入與 64K 輸出上限。部分早期目錄的資訊不同,不能把仲介平台標示的 1M 輸出直接當成官方保證。上下文容量也不代表每一段長文件都能被正確理解。模型文件
官方線上入口與 API 提供平台
可以先開啟 StepFun AI Studio,確認帳戶的模型選單是否提供 Step 5 Preview。開發者可選擇國際版平台或中國版平台;註冊、付款和優惠條件可能不同,台灣使用者應以實際帳戶可用的方案為準。

Vercel AI Gateway是已確認上架的第三方管道,模型 ID 為 stepfun/step-5-preview,也有瀏覽器 Playground。符合資格的免費帳戶可能獲得試用額度,其餘用量依 API 費率計費。這不是 StepFun 自家的訂閱方案。
首次接入可依官方快速入門建立金鑰、選擇模型並傳送小型測試。請先確認課金管道,再接上程式碼儲存庫或具有寫入權限的代理工具。搜尋、執行程式和編輯檔案是由整合應用程式提供,模型本身不會直接操作電腦。
價格:API、月費與實際任務成本
以下是國際版每百萬 tokens 的官方美元費率。目前未確認到新台幣的獨立官方價目,因此不把換匯結果當作台灣售價;實際台幣支出還取決於匯率與發卡機構費用。輸出計費包含推理過程,不只最後看到的答案。官方 API 價格
| 模型 | 未命中快取的輸入 | 命中快取的輸入 | 輸出 |
|---|---|---|---|
| Step 5 Preview | US$1.00 | US$0.05 | US$2.70 |
| Step 3.7 Flash | US$0.20 | US$0.04 | US$1.15 |
以 10 萬個未快取輸入 tokens 加上 1 萬個計費輸出 tokens 計算,Step 5 費用為 US$0.127;若同樣的輸入全部符合快取命中條件,則為 US$0.032。這是純計算範例,不含工具、重試、稅費,也不是每次工作的用量預測。

Step Plan列出的月費為 US$6.99、US$9.99、US$29、US$99,對應 400M、1,600M、8,000M、40,000M Credits。Credits 不等於 tokens。 方案包含 Step 5 Preview,但月額度不會結轉,且使用與一般 API 不同的連線位址。限時免費活動應以結帳畫面為準,不能當成永久權益。
比較時請記錄「取得可採用成果」的成本,包括重試與人工修正。若代理反覆修改同一個錯誤,低 token 單價也可能累積成高費用。
相較 Step 3.7 Flash 的改良

Step 3.7 Flash 為總參數 198B、啟用 11B、256K 上下文,原本就支援圖片與影片。因此 Step 5 的主要升級不是首次加入影片,而是更大的資訊容量和更複雜的工作能力;舊模型仍保有較低 API 單價。前代官方文件
SQBench 的 220 項工作中,Step 5 完全通過 102 項,Step 3.7 Flash 為 43 項。完全通過數與加權總分是不同指標。這支持在舊模型難以完成的工作上試用 Step 5,但不是所有簡單摘要都必須升級的證據。SQBench 實測
與 Claude、GLM、Kimi 的表現比較
Artificial Analysis 記錄的 Intelligence Index 約為 44、生成速度約每秒 100 個輸出 tokens,也指出 token 消耗較多。這個速度不包含完整任務中的全部等待、工具操作與重試。獨立評估
下表是 StepFun 公布的評測:Step 使用 High,競品使用 Max。不是 AirMore 重新執行的測試。
| 模型/設定 | DeepSWE v1.1 | FrontierFinance |
|---|---|---|
| Step 5 Preview/High | 67.7 | 66.4 |
| GLM-5.3/Max | 66.9 | 64.1 |
| Kimi K3/Max | 67.5 | 62.6 |
| Claude Opus 5/Max | 74.0 | 69.7 |
來源與測試條件。Step 在此軟體工程測試接近 GLM 和 Kimi,Opus 則在兩項指標都領先。兩個測試不能代表所有用途。



選型時可用相同專案、相同驗收測試比較 Step、GLM、Kimi;高價值任務再加入 Claude。請固定工具權限、輸入資料及重試次數,避免把代理應用程式的差異誤認為模型差異。
媒體、創作者與社群的真實體驗
SQBench 給 Step 5 的分數為 50.00,DeepSeek V4 Pro 0813 為 51.40,GLM-5.3-FlashX 為 54.60。整套測試記錄的成本與累計時間分別為 US$16.72/25.20 小時、US$9.83/12.12 小時、US$5.68/6.67 小時。這是測試全套工作的數據,不是月費或單一工作的等待時間。完整報告
創作者 cxuan 試了遊戲、依影片重建網站及預算工作。在網站案例中,他較喜歡 Step 的整體結果,但也記錄了重要幾何造型被簡化的問題。這是值得參考的原型製作經驗,不能宣稱為像素級重現能力的保證。實測與作品
LocalLLaMA 討論關注短暫出現的權重;另一則開發者討論仍在徵求實際工作經驗。上市初期的期待不等於長期穩定性的共識,也不代表已完成正式配布。
特長、限制與推薦用途
適合優先測試可重現的程式錯誤、跨文件核對、資料清理與分析,或把截圖和短錄影整理為開發規格。先定義交付格式及驗收條件,才容易判斷模型是否真正完成工作。
程式任務可要求最小修補和回歸測試;文件分析要求來源位置與假設;試算表要求可重算的公式或腳本。這些做法能降低「文字看起來正確,成果卻無法驗證」的風險。
一般聊天、大量簡單改寫及低延遲需求,不一定值得使用較大的模型。繁體中文、台灣用語及公司格式也應以實際文件測試,不能從英文為主的能力排名推論所有語言都同樣好。
本機部署與硬體需求
目前沒有可確認的正式部署配方可推薦。請留意 StepFun 官方 Hugging Face 組織的模型、授權和執行環境文件,而不是只依靠非官方鏡像。
啟用 27B 不代表只需 27B 模型的記憶體。 以 600B 權重估算,16 位元約 1.2TB、8 位元約 600GB、4 位元約 300GB,還沒計入快取、執行開銷與量化資料。這是算術估計,不是已驗證的硬體配置,也不代表對應量化版已存在。
一般使用者先試 API 較實際。尤其想用滿 100 萬上下文時,應等正式釋出後的記憶體與速度測試再購買硬體。
NSFW 支援情況
代管 API 不是無限制的 NSFW 服務。 國際版使用條款禁止露骨色情內容及繞過安全機制。未來開放權重不會自動改變現有 API 條款,權重本身也要另外確認授權。服務條款
本篇沒有執行 NSFW 提示測試。平台許可範圍、模型拒答行為與未來本機版本的條件是不同問題,不應因為「準備開放權重」就認定能用於露骨成人角色扮演。
常見問題
可以免費使用嗎?
標準 API 有使用費。試用額度和限時活動不代表永久免費,長任務開始前應確認剩餘額度與計費方式。
支援影片嗎?
官方直接 API 支援,但第三方平台可能只開放部分輸入方式。請依實際供應商文件設定。
100 萬上下文可以輸出 100 萬 tokens 嗎?
不能這樣理解。官方最大輸出為 64K;可讀取的上下文與回答長度是不同限制。
Step Plan 與 API 儲值共用嗎?
它們是不同的用量系統,也有不同連線位址。呼叫成功不代表用的是訂閱額度。
一定比 Claude、GLM、Kimi 好嗎?
沒有這種通用結論。不同工作有不同優勝者,應比較成果品質、總成本和人工修正。
現在可以下載嗎?
官方預告於 2026 年 10 月 15 日開放權重。請確認正式釋出與授權,勿把短暫出現的檔案當成穩定官方版本。
結論:以完成的工作評估價值
Step 5 Preview 值得在程式修補、長文件分析與多模態代理工作中試用。前代到新模型的改良有獨立評測佐證,但低單價不是總成本最低的保證。
挑幾個代表性任務,設定固定預算,記錄品質、用量、耗時與修正工作量。只移轉真正有改善的部分,簡單工作保留較輕量模型;本機部署則等正式權重釋出後再判斷。
資料確認日期:2026 年 9 月 21 日。本文依官方文件與具名第三方測試整理,AirMore 並未獨立重現所引述的基準測試。