DeepSeek V4多模态模型正式开源,Agent能力接近Opus-4.8
创始人
2026-09-01 13:18:22

【太平洋科技快讯】据 IT 之家报道,DeepSeek V4 系列首款多模态模型 DeepSeek-V4-Flash-Vision-Exp 已经在 Hugging Face 上线,采用 MIT License 开源。

公开内容包含模型权重文件、Tokenizer、Prompt Encoding 参考实现,以及最小化 PyTorch 推理实现,覆盖视觉编码器、Aligner、DFlash Attention、MoE、Hyper-Connections 与 DSpark 等核心模块。

据悉,8 月 21 日下午,DeepSeek 官方 API 文档的模型详情页面就已经上线了该模型。这是 V4 系列当中首款原生支持图片输入的视觉模型。除文本交互之外,模型可接收图片输入,完成图像内容描述、截图文字识别、图表解析等任务,兼容 JPEG、PNG、GIF、WebP 主流图像格式。

深度求索官方介绍,该模型在各类智能 Agent 框架下拥有不错的多模态适配效果,可借助工具拓展更多实际工作场景。在推理、世界知识等纯文本任务层面,性能与 V4-Flash 正式版保持一致,继承原有能力优势;而在视觉类 Agent 基准测试中相比 V4-Flash 实现明显提升,多模态 Agent 能力接近 Opus-4.8 水平。

相关内容

热门资讯

女孩起夜误把电视柜当马桶坐塌,... 8月30日深夜,河南郑州。一名小女孩半夜起床想上厕所,睡得迷糊,把客厅悬浮柜当成了马桶坐上去——整面...
顺义区实木衣柜定制门店正规吗,... 顺义区实木衣柜定制门店正规吗,自有沈阳工厂保障品质 随着北京顺义区居民对居住品质要求的提升,全屋定制...
从田间到茶杯——乌江两岸女贞丸... 在食品安全日益受到关注的今天,一款产品能否获得权威认证,是消费者选择的重要依据。乌江两岸女贞丸凭借其...
意源餐桌椅源头工厂:廊坊优质实... 如今,餐饮市场日益繁荣,消费者对用餐环境和体验的要求不断提高,使得桌椅采购需求从低价刚需向稳定品质与...