金色財經
中國人工智慧初創公司DeepSeek已悄然發布了其旗艦模型的更新版本——DeepSeek-V4-Pro-0813——在開發者社區中反響褒貶不一。 基準測試結果顯示,該模型在通用能力指標上難以與頂級競爭對手匹敵,其性能和定價均令人失望。但在網路安全漏洞檢測這一特定領域,它卻超越了所有其他受測模型——這一發現對於當前關於中國人工智慧在安全研究中作用的爭論具有重要意義。
要點
DeepSeek-V4-Pro-0813在「人工智慧分析指數」中獲得53分——與智普AI"的GLM-5.2持平,但比OpenAI的GPT-5.6 Terra低4分,比Kimi K3低7分
在Vals指數上, 該模型排名第12位——落後於OpenAI的上一代GPT-5.5,同時也落後於Kimi K3和Anthropic的Claude Opus 5
比利時網路安全公司Aikido Security發現,儘管DeepSeek-V4-Pro-0813的精確率較低,但在發現系統漏洞方面卻優於所有其他受測模型
該模型檢測出的漏洞數量遠多於Anthropic的的Opus 5以及阿里巴巴的Qwen 3.8檢測出的漏洞數量顯著更多
其定價引發了批評——每百萬輸入令牌約44美分,被描述為「略顯昂貴」
DeepSeek預計將推出一款名為「harness」的產品——這是一種類似於Claude Code的軟體框架——使該模型能夠作為自主AI代理運行
此次更新悄然推出,未引起轟動。 DeepSeek在其官方網站上發布了一份簡短聲明,指出該模型顯著提升了智能代理的能力——隨後於周四下午刪除了該聲明。此次發布未附帶任何技術部落格文章,這與通常伴隨重大AI模型發布而發布的詳細文檔形成了鮮明對比。
早期的基準測試結果並不令人振奮。 在「人工智慧分析指數」上,DeepSeek-V4-Pro-0813 得分為 53——與智普 AI"今年6月發布的GLM-5.2持平,但比OpenAI GPT-5.6系列中的中端Terra模型低4分,比Moonshot AI的Kimi K3低7分。 在由舊金山Vals AI基於多項基準測試編制的Vals指數中,該模型總排名第12位——落後於OpenAI上一代的GPT-5.5,且遠落後於包括Kimi K3和Anthropic"Claude Opus 5等前沿系統。
在Vals AI的評估中,兩個具體的弱點尤為突出: 在沙盒終端環境中完成任務,以及在Excel電子表格中生成複雜的金融模型。在社交媒體上,開發者們稱該模型令人失望,多名用戶指出存在諸如在長時間編碼任務中模型過早停止等問題。 DeepSeek 未對置評請求作出回應。
普遍的基準測試結果並非全部。 特別是在網路安全漏洞檢測方面,DeepSeek-V4-Pro-0813 產生的結果引起了安全研究人員的關注。
據比利時網路安全公司 Aikido Security 稱,在發現系統漏洞方面,該模型表現優於測試中的所有其他系統。 Aikido的研究員菲利普·杜拉索夫(Philippe Dourassov)指出,儘管該模型的精確度較低——其誤報率高於競爭對手系統——但其檢測出的漏洞總數遠超Anthropic的Opus 5和阿里巴巴的Qwen 3.8。
在漏洞掃描中,精度與召回率之間的權衡是一個眾所周知的考量因素。 在初次安全審計中,一個能標記出更多漏洞(包括部分誤報)的模型,可能比精度更高但檢測率較低的模型更有價值,因為遺漏一個關鍵漏洞的成本通常遠高於調查一個誤報的成本。 Aikido 的研究結果表明,DeepSeek-V4-Pro-0813 無論是在設計上還是在訓練性質上,都更傾向於優化廣泛覆蓋率,而非保守的精確度。
這一網路安全研究結果發布於一個充滿爭議的背景下。 「比特幣紅隊」行動在比特幣開源基礎設施中發現了數千個安全漏洞,該行動在很大程度上依賴於包括 Kimi K3 在內的中國開放權重模型,因為美國前沿模型曾多次阻撓合法的防禦工作。 DeepSeek在漏洞檢測方面展現出的實力,為正在顯現的趨勢提供了又一例證:在安全研究人員最迫切需要的具體任務上,中國AI模型的表現優於受限的美國系統。
DeepSeek"在市場上的聲譽很大程度上建立在成本效益之上——7月31日發布的V4 Flash模型因其極高的性價比而廣受讚譽,據稱其定價曾令矽谷為之震驚。而V4 Pro的更新卻未能延續這一聲譽。
該模型每百萬輸入令牌的價格約為44美分,Artificial Analysis認為,與市場中位數33美分相比,該模型價格略高。 輸出令牌定價為每百萬87美分,被描述為價格適中。 在Artificial Analysis智能指數中,該模型每項任務成本為6美分,運行成本略高於OpenAI的輕量級GPT-5.6 Luna(5美分)——儘管其成本仍比Moonshot AI"的Kimi K3(每項任務84美分)仍便宜約93%。
DeepSeek上周宣布,由於需求激增,其所有模型將大幅提價,這使得定價形勢更加複雜。該公司建議用戶據此規劃使用計劃——這表明當前的定價(已被描述為高於市場中位數)可能並非最低價。
儘管V4 Pro的反響褒貶不一, DeepSeek 正在籌備一款產品,有望顯著拓展該模型的實際應用範圍。 該公司預計將推出 DeepSeek Harness——一個類似於 Anthropic 的 Claude Code 的軟體框架——它能使大型語言模型作為自主 AI 代理運行,僅需極少的人工指導即可執行多步驟任務。
DeepSeek 已邀請開源開發者參與即將推出的 Harness 產品的 beta 測試,並於 7 月為團隊註冊了一個微信賬號。 對於這家其更新後的旗艦產品明確強調增強代理能力的公司而言,代理框架是合乎邏輯的下一步——即使底層模型的一般基準測試結果尚未達到預期。
一個基於已證實具備強大漏洞檢測性能的模型構建的自主代理框架——無論其在通用編碼和推理基準測試中的排名如何——對網路安全領域的影響,可能比其整體基準排名所顯示的更為深遠。
來源
《南華早報》關於 DeepSeek-V4-Pro-0813 版本發布的報導,2026年8月。 人工智慧分析指數評分與定價分析,2026年8月。Vals AI Vals指數基準測試結果,2026年8月。Aikido Security漏洞檢測評估,菲利普·杜拉索夫,2026年8月。DeepSeek官網關於V4 Pro增強型智能代理能力的聲明,2026年8月。 DeepSeek V4 Flash模型發布及矽谷反應,2026年7月31日。DeepSeek漲價公告,2026年8月。DeepSeek Harness測試版邀請及微信賬號註冊,2026年7月至8月。
來源:金色財經
發佈者對本文章的內容承擔全部責任
在投資加密貨幣前,請務必深入研究,理解相關風險,並謹慎評估自己的風險承受能力。不要因為短期高回報的誘惑而忽視潛在的重大損失。
暢行幣圈交易全攻略,專家駐群實戰交流
▌立即加入鉅亨買幣實戰交流 LINE 社群(點此入群)
不管是新手發問,還是老手交流,只要你想參與加密貨幣現貨交易、合約跟單、合約網格、量化交易、理財產品的投資,都歡迎入群討論學習!
下一篇