国产大模型厂商DeepSeek推出了一款面向Agent(智能体)时代的多模态模型。
8月21日,DeepSeek宣布全新的多模态视觉理解模型V4-Flash-Vision-Exp上线DeepSeek API平台,开启多模态API服务。
据介绍,V4-Flash-Vision-Exp是一个实验性质的模型,在纯文本能力(Agent、推理、世界知识等)方面,DeepSeek-V4-Flash-Vision-Exp 与 DeepSeek-V4-Flash正式版持平;在需要视觉理解的Agent Benchmark上,DeepSeek-V4-Flash-Vision-Exp相比 DeepSeek-V4-Flash实现了大幅跃升,多模态 Agent能力已接近Opus-4.8。
在API支持方面,用户可以通过设置model='deepseek-v4-flash-vision-exp' 来访问V4-Flash-Vision-Exp模型的API。在API服务中,图片会转换成token后按token计费,一张图片最多占384 tokens,计费价格与V4-Flash模型一致。
官方给出的案例显示,V4-Flash-Vision-Exp在各类Agent框架内展现出了较好的多模态适配能力,例如在Agent框架下生成商业定制西藏自驾游PPT,对DeepSeek Harness官网进行二次创作,以及制作黏土怪物风格动态特效的前端Mini Demo。
随着视觉模型上线,DeepSeek同步推出Files API。开发者可以先上传图片文件,随后通过 file_id 在不同请求中引用同一文件,无需重复上传。
同一天,DeepSeek Harness宣布更新,支持官方多模态。据介绍,自开发者预览版v0.1.0-rc.6首日发布以来,DeepSeek Harness已连续完成三次版本更新:v0.1.0-rc.7、v0.1.0-rc.8,以及今天发布的v0.1.1-rc.1,这三次更新主要围绕多模态能力、子代理协作、跨平台兼容和日常使用体验展开。
其中,DeepSeek Harness多模态能力进一步增强,DeepSeek模型适配器新增DeepSeek-V4-Flash-Vision-Exp多模态模型选项,并支持配置原生图片请求。/goal、/plan等命令可接收图文输入,@菜单可引用文件和会话;MCP/ACP同时支持图片附件持久化,PTC Mode支持转发嵌套图片。
近日,DeepSeek密集上新。7月31日,DeepSeek宣布,DeepSeek-V4-Flash正式版API上线公测。8月13日,DeepSeek Harness 的开发者预览版(v0.1 版本)面向全球Harness开发者开放测试,并同步以MIT协议开放源代码。