DeepSeek V4-Flash-Vision-Exp上线:多模态API正式开放

商业品牌
2026 08-22 06:59:34
分享

  【CNMO科技消息】8月21日消息,深度求索宣布,全新的多模态视觉理解模型DeepSeek-V4-Flash-Vision-Exp正式上线DeepSeek API平台。作为一款实验性质的模型,该模型在保留文本理解、推理和Agent能力的同时,进一步加入视觉理解能力,用户可以通过API直接调用。此次更新也意味着DeepSeek进一步将多模态能力向Agent应用场景延伸,为PPT制作、网页开发以及前端创意等任务提供新的模型能力支持。

DeepSeek
DeepSeek

  从官方公布的信息来看,DeepSeek-V4-Flash-Vision-Exp的核心特点在于兼顾文本和多模态能力。在Agent、推理、世界知识等纯文本任务中,该模型的表现与DeepSeek-V4-Flash正式版基本持平,并没有因为增加视觉能力而明显牺牲文本处理能力。而在需要理解图像内容的Agent Benchmark中,新模型相比DeepSeek-V4-Flash则实现了明显提升,多模态Agent能力已经接近Opus-4.8。

  在实际应用方面,深度求索展示了多个使用案例。其中一个场景是借助Agent框架制作商业定制西藏自驾游PPT。用户可以直接提出包括路线、行程周期、目标客户以及视觉风格在内的复杂要求,模型随后结合多模态能力完成内容和视觉呈现。另一个案例则是对DeepSeek Harness官网进行二次创作,通过黑蓝深海、玻璃UI以及ASCII原子像素等视觉元素,在多轮交互后生成具有未来主义风格的开发者网站。此外,模型还可以用于制作动态前端Mini Demo,例如按照“3D黏土小怪物加入复古舞池派对”的创意生成相应的动态视觉效果。

  从这些案例可以看出,此次升级的重点并不只是让模型具备“看图”能力,而是希望将视觉理解进一步融入Agent工作流程。对于需要同时处理文字、图片、网页以及代码的任务而言,模型能够理解视觉信息后,可以进一步参与内容生成、页面设计和交互开发,从而覆盖更多此前主要依靠文本模型完成效果有限的使用场景。

  API服务方面,开发者可以通过设置model='deepseek-v4-flash-vision-exp'调用这一实验模型。图片在API服务中会转换为Token并按照Token计费,单张图片最多占用384个Token,整体计费价格与DeepSeek-V4-Flash保持一致。接口目前支持Chat Completions、Messages和Responses三种调用格式,并支持图文混合输入。图片既可以通过Base64内联方式传入,也可以使用外部URL或Files API进行调用,因此能够适配不同的Agent开发框架和应用场景。

  与此同时,深度求索还宣布Files API正式开放,而且该API本身不收取费用。开发者可以提前将图片上传至平台,之后在API请求中直接通过file_id引用对应文件,无需在每一次请求中重复上传同一张图片。对于需要反复调用相同素材的Agent应用而言,这种方式能够减少重复传输带来的带宽开销,也有助于简化开发流程。

来源:手机中国
The End
免责声明:本文内容来源于第三方或整理自互联网,本站仅提供展示,不拥有所有权,不代表本站观点立场,也不构成任何其他建议,对本文以及其中全部或者部分内容、文字的真实性、完整性、及时性不作任何保证或承诺,请读者仅作参考,并请自行核实相关内容,不承担相关法律责任。如发现本站文章、图片等内容有涉及版权/违法违规或其他不适合的内容, 请及时联系我们进行处理。