返回资讯列表
ithome
•2026-08-31 19:35DeepSeek-V4-Flash-Vision-Exp 模型已开源,多模态 Agent 能力接近 Opus-4.8
IT之家 8 月 31 日消息,刚刚,DeepSeek V4 首个多模态模型 DeepSeek-V4-Flash-Vision-Exp 在 Hugging Face 上线,采用 MIT License 开源。
公开内容包括模型文件、Tokenizer、Prompt Encoding 参考实现,以及最小化 PyTorch 推理实现,覆盖视觉编码器、Aligner、DFlash Attention、MoE、Hyper-Connections 与 DSpark 等核心模块。
据IT之家了解,DeepSeek-V4-Flash-Vision-Exp 是 DeepSeek V4 系列首款原生支持图片输入的视觉模型,官方明确标注为“Exp”实验版本,于 2026 年 8 月 21 日上线 DeepSeek API 平台。
该模型支持在文本之外输入图片,可以让模型描述图片、识别截图中的文字、分析图表等。支持的图片格式包括 JPEG、PNG、GIF、WebP。
深度求索官方表示,V4-Flash-Vision-Exp 在各类 Agent 框架内展现出了较好的多模态适配能力,能够有效支持大家借助多样化的 Agent 工具解锁更多实用的工作场景。在 Agent、推理、世界知识等纯文本任务上与 V4-Flash 正式版持平,原有优势完整保留。在需要视觉理解的 Agent 基准测试中较 V4-Flash 大幅提升,多模态 Agent 能力已接近 Opus-4.8。
最新资讯
智谱披露下一代大模型规划:采用大基座路线,目标发布首日即可支持满规模业务调用
ithome•2026-08-31 20:47
AMD、思科、HUMAIN 合作落地,Instinct MI355X 算力进驻沙特
ithome•2026-08-31 20:45
联发科将基于英伟达 NVLink Fusion 为客户开发定制 XPU
ithome•2026-08-31 20:34
芬兰人工智能超级计算机 LUMI-AI 将采用 AMD 硬件方案,2027H2 部署
ithome•2026-08-31 20:23
谷歌 AI 应用 Dreambeans 取消订阅制,开放免费测试
ithome•2026-08-31 19:46