DeepSeek發布視覺理解模型,大藍鯨等來遲的眼睛
BlockBeats 律動財經
2026 年 8 月 21 日,DeepSeek 推出全新的視覺理解模型 deepseek-v4-flash-vision-exp,多模態 API 正式開放。開發者第一次可以把圖片直接送進 DeepSeek 的官方接口。
模型保留了 V4 Flash 的 100 萬 token 上下文和 38.4 萬 token 最大輸出,支持 JSON Output、Tool Calls、Responses API,也兼容 Anthropic API。
價格也完全沿用 V4 Flash。每百萬 token 輸入,緩存未命中時,高峰期 3 元,空閒期 1.5 元;緩存命中分別是 0.1 元和 0.05 元。輸出高峰期 9 元,空閒期 4.5 元。北京每天 9 時至 12 時、14 時至 18 時屬於高峰,其餘 17 個小時半價。
圖片同樣按 token 結算。進入模型前,每張圖片都會根據尺寸自動縮放,小於約 384×384 像素的會被放大,大圖則會被壓到約 800×800 像素的總像素量。單張圖片最多占 384 個 token。一張 2000×2000 的圖片和一張 5000×5000 的圖片,最後可能花掉完全一樣的 token。
按照 384 token 的上限,一張圖片在高峰期、緩存未命中的輸入費用約為 0.001152 元。處理一千張這樣的圖片,圖片輸入本身也只有約 1.152 元,文字和模型輸出另算。
一起上線的還有 Files API。開發者可以提前上傳圖片,再把 file_id 放進請求。同一張圖只需要傳一次,之後可以在不同請求裡反覆引用。
這個 API 本身不收費。單個文件最大 64 MiB,每個用戶最多存 25 GiB、10000 個文件。文件可以設定在 1 小時到 30 天後過期,不設定有效期則可以一直保留。目前官方也沒有提供下載文件內容的接口。開發者可以上傳、查詢和刪除,模型可以讀取。它更像一個專門給推理準備的免費圖片倉庫,而不是普通雲端。
不過奇怪的其實不是 DeepSeek 到今天才會看圖。
兩條時間線
如果只看研究,DeepSeek 的視覺並不晚。
如果只看產品和 API,它又確實晚了很久。
2024 年 3 月 11 日,DeepSeek-VL 開源。
它有 1.3B 和 7B 兩個版本,能看自然圖片、網頁、公式、圖表和文件。到了 10 月,Janus 出現,把圖像理解與生成放進同一套自回歸框架。11 月 13 日,JanusFlow 跟進。12 月,DeepSeek-VL2 發布,換成混合專家架構,總參數量分成 3B、16B 和 27B 三檔。
2025 年 1 月 28 日凌晨,除夕,Janus-Pro 開源。官方倉庫按照 UTC 記在 1 月 27 日。
7B 版本在 GenEval 這項文字生成圖片的指令遵循評測裡拿到 0.80,超過論文所列 DALL-E 3 的 0.67。它有開源權重,可以本地部署,也有公開演示。
DeepSeek 沒有把它接進自己的託管 API。
就在此前一周,R1 已經把 DeepSeek 推到了聚光燈下面。Janus 留在 GitHub 和 Hugging Face。對絕大多數普通用戶來說,它很快又消失在了視野裡。
2025 年 10 月 20 日,DeepSeek-OCR 開源,用視覺 token 壓縮長文檔。2026 年 1 月 27 日,OCR 2 發布。
從 DeepSeek-VL 開始算,兩年裡至少能查到 DeepSeek-VL、Janus、JanusFlow、VL2、Janus-Pro、OCR 和 OCR 2 七條公開記錄。
視覺研究一直在做,也一直往外放。
只是普通開發者一直沒有那個入口。
而另一邊,到 2024 年 3 月,幾家主要競爭對手的開發者介面都已經可以接收圖片。OpenAI 在 2023 年 11 月開放 GPT-4 Turbo with Vision,圖片可以直接進入 Chat Completions API;一個月後,Google 上線 Gemini Pro Vision API;2024 年 3 月,Claude 3 全系加入視覺能力。
2025 年 4 月 25 日,李彥宏在百度 Create 大會上說,「DeepSeek 也不是萬能的」。隨後列出的幾個問題裡,就有模態單一。
他的判斷是,多模態會成為基礎模型的標準配備,純文本模型的市場會越來越小。
那時候,DeepSeek 已經做了一年視覺研究。
凌晨
2026 年 4 月 7 日和 8 日,部分用戶打開 DeepSeek,介面裡突然多出三個入口。
「快速」「專家」「視覺」。
4 月 29 日,DeepSeek 多模態團隊負責人陳小康確認識圖功能開始面向部分用戶灰度。隨後,DeepSeek 一名資深研究員寫道,「小鯨魚現在能看見了」。南華早報直接把這句話放進了標題。
DeepSeek 的眼睛第一次真正從產品介面裡露出來。
第二天,DeepSeek 把《Thinking with Visual Primitives》放上 GitHub。幾個小時以後,倉庫和論文又被撤下。到了 5 月 1 日,原地址已經返回 404。DeepSeek 沒有解釋,網上只剩下論文鏡像和媒體轉述。
論文研究的是一個很具體的問題。
模型看到一張很擁擠的圖片以後,常常知道自己在說什麼,卻說不清自己說的究竟是哪一個人、哪一條線。團隊把點座標和邊界框直接插進推理過程,讓模型一邊指出位置,一邊繼續往下想。
一張 756×756 的圖片先經過視覺編碼器,變成 2916 個圖像塊 token,再通過 3×3 空間壓縮合成 324 個 token。V4 Flash 的稀疏注意力繼續壓縮緩存,最後只留下 81 個視覺 KV 條目。
團隊還為這套方法生成了超過 4000 萬條訓練樣本,其中包括專門訓練迷宮導航和路徑追蹤的數據。
這篇論文花了很大力氣解決的,其實是「指哪兒」。
模型先得看見,再得知道自己正在看哪裡。只有這樣,它才能繼續往下推理。
DeepSeek 這次沒有說明 Vision Exp 是否完整沿用了這套 Visual Primitives 方案。更重要的是,這項研究第一次把 DeepSeek 對「視覺推理」的理解暴露在了外面。
6 月 18 日,網頁和 App 的識圖模式正式上線。第二天,有媒體上傳梁文鋒的照片測試,DeepSeek 連續兩次把他認成張一鳴。換一個對話,它又把張一鳴認成寒武紀創始人陳天石。
它已經能讀英文截圖,也能把網頁轉成代碼。
到了人臉面前,卻連自己老闆都認不出來。
8 月 19 日,DeepSeek Harness 留下一份日期明確的技術說明。官方適配器已經能夠把圖片序列化成 image_url,文檔同時寫明,默認模型目錄暫時不會展示 deepseek-v4-flash-vision-exp,需要等對應的 API 端點可用。
8 月 20 日,還有開發者實測發現,給這個尚未開放的模型名傳圖,只會收到 400 錯誤。
8 月 21 日,這個限制被拿掉。Harness 把 deepseek-v4-flash-vision-exp 加進默認模型目錄,對應的合併提交直接寫著「publish the vision model」。隨後,DeepSeek 官方 API 文件和公眾號同時宣布 Vision Exp 上線。
兩條線終於碰到了一起。
Agent
在今年 5 月一場投資者交流會的錄音轉寫裡,梁文鋒把自己理解中的 AGI 路線排成了幾級台階:語言模型、思維鏈、Agent、持續學習、自我迭代,再到具身智能。
多模態被他放在組件的位置,和搜尋差不多。
談到視頻生成時,轉寫裡有一句話:
在商業上,它是個好生意。但是這跟智能沒有什麼關係。
他的判斷是,視頻生成、世界模型在當前階段和智能上限的關係沒有那麼大,眼前更要緊的是 AI 訓練,以及訓練之後的持續學習。
多模態不一樣的地方在於,它雖然也被放在「元件」的位置,卻是 DeepSeek 明確說過一定會做的元件。梁文鋒當時還提到,V4 以及後續版本會支援原生多模態。
視覺在 DeepSeek 的路線裡一直有位置,只是排得沒有那麼靠前。
等路線走到第三步 Agent,情況開始有些不一樣了。
DeepSeek 沒有公開說過,這次視覺 API 是「為了 Agent 才上線」。但把梁文鋒對路線的判斷和今天的發布放在一起,兩條線已經很難完全分開看。
Agent 要讀屏幕,要看圖表,要處理工具設回來的截圖。它不可能永遠生活在純文字裡。那些已經做了兩年的視覺能力,也終於從論文、倉庫和測試頁面裡,一路走到了 API。
DeepSeek 今天給 Vision Exp 展示的三個例子也都不是傳統的「看圖說話」:一個 Agent 給高端客戶製作西藏自駕遊 PPT,一個重新設計 DeepSeek Harness 官網,還有一個根據視覺要求製作帶動態效果的前端 Demo。
它們都需要模型在長流程任務裡反覆處理視覺資訊。
API 的設計也在往這個方向靠。Responses API 同樣接受 input_image,瀏覽器 Agent 可以拿到網頁截圖以後,把它重新送進下一輪推理;程式碼 Agent 可以檢查渲染結果,圖表、掃描件和軟體介面也能直接成為上下文。
Files API 則解決另一件事:同一張圖不用在每輪請求裡重複上傳。一個檔案可以長期放在那裡,Agent 只需要反覆傳 file_id。單次請求最多還能放 600 張圖片。使用外部連結或 Base64 時,單張圖片上限是 32 MiB,通過 Files API 引用後可以到 64 MiB。
這已經不太像給聊天框加一個「上傳圖片」按鈕。
它更像是在補 Agent 使用視覺時需要的基礎設施。
DeepSeek 公佈的四項多模態 Agent 對比,也很少在考傳統意義上的「看圖說話」。
ApexBench 關注投行、諮詢和法律等長流程任務。Agents" Last Exam 來自 55 個專業領域的真實工作。Chartography 專門考 Kaplan-Meier 曲線、K 線、等高線、桑基圖和波特圖。ZeroBench 則用 100 道人工設計的難題測試多步視覺推理。
Vision Exp 對 Claude Opus 4.8 拿到兩勝兩負。
Agents" Last Exam 是 27.3 對 25.7,ZeroBench 是 35.0 對 34.0。ApexBench 為 36.5 對 39.4,Chartography 為 64.3 對 65.0。四項差距都沒有超過 3 分。
更有趣的是,加上視覺以後,原來的文本 Agent 能力沒有明顯掉下去。
和 7 月 31 日發布的純文本 V4 Flash 逐項比較,官網同時給出前後成績的五項文本 Agent 評測全部上漲。
Terminal Bench 2.1 從 82.7 漲到 83.9,NL2Repo 從 54.2 到 57.7,DeepSWE 從 54.4 到 59.3,DSBench-Hard 從 59.6 到 63.6,AutomationBench 從 25.1 到 25.7。DeepSWE 的 59.3,也超過了圖中 Opus 4.8 的 58.0。
不過,這組數字來自 DeepSeek 自己的測試。官方註明,公開 Code Agent 文本任務中的 DeepSeek 系列模型使用 DeepSeek Harness 極簡模式,推理檔位設為 max。它們更適合用來觀察 Vision Exp 相比自家 V4 Flash 的變化,而不是直接當成第三方獨立排名。
模型名字後面的 exp 也還沒有摘掉。
DeepSeek 明確把它標成實驗模型,版本仍然可能繼續變化。現在的接口只做圖片理解,輸出依然是文字。圖片生成和視頻沒有開放,Files API 也只接受 JPEG、PNG、GIF 和 WebP,PDF 不能直接塞進去。
2024 年,開發者想給 DeepSeek 發一張圖片,官方 API 還接不住。
到 2026 年 8 月 21 日,這張圖片終於進來了。
DeepSeek 的眼睛確實睜開得晚。
等它真正睜開的時候,前面的路已經不允許它繼續閉著眼睛走了。
發佈者對本文章的內容承擔全部責任
在投資加密貨幣前,請務必深入研究,理解相關風險,並謹慎評估自己的風險承受能力。不要因為短期高回報的誘惑而忽視潛在的重大損失。
暢行幣圈交易全攻略,專家駐群實戰交流
▌立即加入鉅亨買幣實戰交流 LINE 社群(點此入群)
不管是新手發問,還是老手交流,只要你想參與加密貨幣現貨交易、合約跟單、合約網格、量化交易、理財產品的投資,都歡迎入群討論學習!
- 讓加密貨幣幫你滾出年化30%現金流
- 掌握全球財經資訊點我下載APP
- 講座
- 公告
上一篇
下一篇