随手先关注,不错过每日AI热讯速递
①
8 月 21 日,DeepSeek API 官方文档宣布实验性多模态模型 DeepSeek-V4-Flash-Vision-Exp 已上线 API 平台。[1]
这款多模态模型(能同时处理文字和图像,并把两种信息放进同一次模型调用)官方称它在智能体、推理和世界知识等文本能力上与 V4-Flash 相当。[1]
在多模态智能体基准上,DeepSeek 称新模型较 V4-Flash 有明显提升,表现接近 Opus-4.8。[1]这个结论来自发布方自己的基准,不能直接理解成独立测试已经证明全面领先。[2]
![]()
图:DeepSeek API 官方发布页一文中的 benchmark 配图(来源:DeepSeek API Docs)[1]
②
新模型没有另起一套封闭接口。官方文档列出 Chat Completions、Messages 和 Responses 三种调用形态,也支持把文字和图片放进同一个请求。[1]
图片可以通过 base64、外部 URL 或 Files API 传入。计费时,每张图片最多按 384 个 token 计算,价格沿用 V4-Flash。[1]
Files API(是把图片先上传、再用文件编号反复调用的接口)也在公告中免费开放。用户上传一次图片后,可以用 file_id 重复引用,减少重复传输;DeepSeek Harness 0.1.1 同步加入了新模型的开箱即用支持。[1]
③
这次更新的变化,不只是模型多了一个看图能力。智能体(能根据任务调用模型和外部工具自动完成多步工作)现在可以把截图、文档页或其他视觉材料直接放进既有的请求链路里。[1]
对开发者来说,接口统一比单独增加一个视觉模型更重要。原本处理文字的工作流,可以继续使用同一套请求形式,再把图像作为上下文交给模型;Files API 则照顾了需要反复读取相同素材的场景。[1]
The Decoder 也将这次发布描述为给 V4-Flash 增加图像理解能力,并把多模态智能体表现放在接近 Opus-4.8 的区间内。[2]但公开公告没有给出完整测试集、样本量和独立复现实验,性能判断仍要留出余地。
④
DeepSeek 选择先把视觉能力接进 API 和智能体工具链,说明多模态竞争正在从“能不能看图”转向“能不能在真实任务里持续调用”。这是产品形态的变化,不等于单项 benchmark 数字已经解决了所有问题。[1]
读者还需要留意两个边界:384 token 是官方给出的单张图片计费上限,不是所有图片都会实际消耗同样数量;“接近 Opus-4.8”也是发布方基准中的表述,不能改写成普遍意义上的模型排名。[1][2]
你会把截图、文档还是照片交给这个模型?欢迎在评论区分享你最想用它完成的智能体任务。
参考来源:
[1] DeepSeek API Docs:DeepSeek-V4-Flash-Vision-Exp Release: Multimodal API Now Livehttps://api-docs.deepseek.com/news/news260821/
[2] The Decoder:Deepseek releases experimental Flash vision model that rivals Opus 4.8 on agent benchmarkshttps://the-decoder.com/deepseek-releases-experimental-flash-vision-model-that-rivals-opus-4-8-on-agent-benchmarks/
欢迎分享、点赞、推荐
一起拥抱AI
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.