一個震撼中國AI圈的消息在八月下旬悄悄釋出:DeepSeek官方在社群平台X上扔出一顆炸彈,代號V4-Flash-Vision-Exp的實驗性多模態模型正式上線API平台。沒有華麗的發表會,沒有鋪天蓋地的媒體預告,就這麼一條推文,卻讓許多開發者連夜打開DeepSeek的文件頁面。
因為這不是普通的視覺模型——它是在DeepSeek最強純文本模型V4-Flash的基礎上長出來的「眼睛」,而且宣稱在需要視覺理解的Agent測試中,性能已經接近Anthropic那款頂尖的Claude Opus 4.8。說得更直白一點,這家中國新創正用一種極快的節奏,悄悄縮短與美國AI巨頭之間的距離。
表象:一個實驗版本,兩種能力的維持與突破
根據DeepSeek公布的資訊,這款V4-Flash-Vision-Exp本質上是旗艦純文本模型V4-Flash的實驗性延伸。它的核心設計哲學很有意思:不犧牲純文本戰鬥力,額外疊加視覺理解這項新武器。官方強調,在Agent任務、推理能力和世界知識這幾個純文本關鍵指標上,視覺版本與V4-Flash正式版維持在同一水準。
但在多模態Agent評測中,V4-Flash-Vision-Exp相比V4-Flash出現了「大幅躍升」。這句話背後代表什麼?代表它不只是「看圖說故事」,而是能理解螢幕截圖中的UI元素、圖表中的數據趨勢,甚至根據視覺輸入做出後續行動決策。這樣的描述,很難不讓人聯想到Anthropic那款以電腦操作能力聞名的Claude Opus 4.8。
從產業面來看,DeepSeek這一步走得非常精準。多數中國AI公司在追趕純文本模型時,往往忽略了多模態與Agent結合的應用場景。但DeepSeek選擇直接在V4-Flash這條成熟產品線上疊加視覺能力,而不是另起爐灶,這種策略大幅縮短了開發時程。如果V4-Flash-Vision-Exp在多模態Agent的實際表現真如官方所說「接近Opus 4.8」,那它將是現階段中國AI公司中,少數能在視覺Agent賽道上跟國際一線品牌叫陣的產品。
真相:API先行的務實路線,開發者才是真考官
這次發布與其說是面向一般消費者的產品發表,不如說是一場對開發者社群的技術展示與誠意測試。DeepSeek把V4-Flash-Vision-Exp直接放上API平台,支援Chat Completions、Messages、Responses三種調用格式,圖片傳入方式也給得很大方:base64內聯、外部URL、Files API三種全包。
這種做法透露了一個明確的訊號:DeepSeek想要的是真實場景的壓力測試。實驗版本四個字已經說明了它的定位——它不是最終成品,而是一個邀請開發者一起打磨的開端。讓開發者透過API把模型接入各種Agent工具,在真實應用中找出盲點與改進空間,這比任何實驗室內的評測數據都更有說服力。
話說回來,DeepSeek並不是第一次碰視覺模型。過去他們就推出過DeepSeek-VL系列,但那些產品多是獨立的多模態模型。這次的關鍵差異在於,視覺能力被直接整合進最先進的V4-Flash系列,代表多模態不再是旁支路線,而是旗艦產品核心功能的一部分。這個轉折,值得留意。
各方角力:視覺Agent的賽道,比你想的更擠
Anthropic的Claude Opus 4.8之所以備受關注,很大一部分原因是它在電腦操作自動化(Computer Use)這個領域展現了驚人的潛力——你可以叫它看螢幕、操作介面、完成跨應用的複雜任務。如今DeepSeek直接拿自家的視覺模型去對標Opus 4.8,等於公開宣示:我也要在這條賽道上參一腳。
「接近」這個詞在AI領域永遠帶著微妙的模糊地帶。是多近?是特定任務接近還是全面接近?是評測分數接近還是實際體驗接近?DeepSeek沒有公布具體的Benchmark數字,這點讓人有點心癢。但作為一個從純文本模型一路緊追不捨的玩家,DeepSeek敢在官方帳號上公開喊出這句話,至少代表他們內部對這個實驗版本的表現是有一定信心的。
回顧過去一年,中國AI公司的國際能見度逐漸攀升,但多數焦點仍集中在純文本模型的追趕。DeepSeek這次的動作,等於把戰場從純文本拉到「視覺+行動」這個更高維度的領域。而這恰恰是當前國際AI巨頭們公認的下一波決戰點。
深層影響:模型能力過剩時代的另類突圍
如果我們退一步看,這波發布背後藏著一個更大的產業趨勢:純文本模型的技術紅利正在邊際遞減。各家旗艦模型的文字理解與生成能力差距越來越小,接下來要比的就是誰能在多模態、工具使用、自主行動這些延伸能力上率先做出差異化。
DeepSeek選擇先在V4-Flash這個成熟的基底上做實驗,等於用最低風險的方式探索多模態Agent的技術邊界。一旦這個實驗版本獲得開發者社群的正面回饋,這些經驗很快就能反饋到下一代旗艦模型的設計中。這種務實的研發節奏,說不定比一次推出一個完美但封閉的產品更有效。
對一般使用者來說,短期內可能不會直接感受到V4-Flash-Vision-Exp的影響。但對那些正在開發AI Agent應用、自動化工具、智慧助理的團隊而言,這個模型的出現代表他們多了一個成本可能更低、整合可能更順暢的選擇。而成本與整合彈性,往往決定了一個技術能不能從實驗室走進真實世界。
換個角度想,DeepSeek這一步也像是在對市場喊話:我不只會做文字模型,我正在打造能真正「看見」並「行動」的AI。這對開發者社群來說是一個值得認真對待的訊號。如果你正在做視覺Agent相關的應用,現在或許是花幾個小時把API接起來測試看看的時候了。實驗版本代表它還不完美,但也代表現在的回饋最有機會影響它未來迭代的方向。
未解之問:接近不等於超越,下一步才是關鍵
回到那個最關鍵的問題:接近Anthropic Opus 4.8,然後呢?
「接近」是一個狀態,不是一個終點。DeepSeek的V4-Flash-Vision-Exp在特定評測上或許真的與Opus 4.8差距不大,但實際部署時的安全性、穩定性、多步驟任務的執行成功率,這些才是真正考驗模型價值的戰場。而這些細節,目前為止我們還沒有看到更多公開的第三方驗證。
另一個值得追問的方向是:這個實驗版本的多模態能力,是單純的視覺理解,還是已經具備類似Claude那樣的電腦操作能力?官方說的是「接近Anthropic的Claude Opus 4.8」,但沒有具體說明是在哪個維度上接近。這兩者之間的差距,可能比我們想像的更大。
無論如何,DeepSeek已經把棋下了出去。接下來幾週,開發者社群的反應、API的實際使用回饋、以及第三方評測機構的測試結果,將會決定這盤棋的下一步走向。而你如果有機會透過API試玩看看,也許會比任何評測報告都更早看到這款模型的真實樣貌。
現在的問題已經不是「DeepSeek能不能追上」,而是「它想在哪個賽道上超越」。視覺Agent這條路,看來他們已經決定要走下去了。
編輯觀點:DeepSeek這次的發布,其實是在向整個AI產業丟出一個訊號:多模態Agent的技術門檻,沒有大家想像的那麼高不可攀。Anthropic有Opus 4.8,OpenAI有GPT-4o的視覺能力,Google有Gemini,現在DeepSeek說我也行。這對開發者來說是好事——更多選擇、更多競爭、更快的迭代速度。但對DeepSeek自己來說,真正的考驗在於能不能把「實驗版本」的潛力,轉化成「正式版本」的穩定實力。接下來三個月,會是觀察這款模型真實價值的關鍵期。
【行動呼籲】
如果你正在開發AI Agent、自動化流程工具、或任何需要模型「看懂畫面再做決定」的應用,現在或許是打開DeepSeek官方文件、申請API權限的最好時機。實驗版本的意義就在於——你的每一次測試、每一則回饋,都可能成為這款模型進化的重要養分。別等它變成正式版才開始摸索,那時候競爭優勢可能已經被別人先搶走了。
本文改寫整理自公開新聞來源,原始報導由科技新報發布。
常見問題 FAQ
DeepSeek V4-Flash-Vision-Exp跟原本的V4-Flash有什麼不同?
最大的差異在於新增了多模態視覺理解能力。V4-Flash是純文本模型,而V4-Flash-Vision-Exp在這個基礎上增加了圖像和螢幕截圖的分析功能,而且純文本的Agent、推理、世界知識等能力維持不變。
這個模型現在能用嗎?要怎麼使用?
已經可以用了。開發者可以透過DeepSeek的API平台存取這款模型,支援Chat Completions、Messages、Responses三種調用格式,圖片可以用base64、外部URL或Files API三種方式傳入。
它真的接近Anthropic Claude Opus 4.8嗎?
根據DeepSeek官方說法,在需要視覺理解的Agent評測上,V4-Flash-Vision-Exp的表現已接近Claude Opus 4.8。但實際表現還是建議開發者自行透過API測試,尤其注意「接近」在不同任務類型上的具體差異。
這個視覺模型可以用在哪些場景?
主要適合需要「看懂畫面再行動」的場景,例如螢幕操作自動化、UI測試、圖表數據解讀、以及各種需要視覺輸入的AI Agent應用。因為支援圖文混合輸入,也很適合做多模態對話機器人。
V4-Flash-Vision-Exp是免費的嗎?
目前是透過DeepSeek API平台提供,API使用通常會產生費用,具體定價需要查閱DeepSeek官方的最新公告或API文件。它被標示為實驗版本,這類版本有時會有不同的計價或配額方案。
※ 此篇文章由 AI 改寫或生成,內容僅供參考,可能存在錯誤或不準確之處。