AI HOT 精选

DeepSeek-V4-Flash-Vision-Exp 模型已开源,多模态 Agent 能力接近 Opus-4.8

8.5内容质量

TL;DR · AI 摘要

DeepSeek 开源多模态模型 V4-Flash-Vision-Exp,支持图片输入且能力接近 Opus-4.8,采用 MIT 许可证。

核心要点

  • DeepSeek-V4-Flash-Vision-Exp 支持 JPEG/PNG/GIF/WebP 四种图片格式输入
  • 模型在多模态 Agent 基准测试中性能较 V4-Flash 提升显著
  • 开源内容包含完整推理实现与核心模块代码

结构提纲

按章节快速跳转。

  1. DeepSeek 在 Hugging Face 开源多模态模型 V4-Flash-Vision-Exp,采用 MIT 许可证。

  2. 包含视觉编码器、Aligner、DFlash Attention 等核心模块的完整实现。

  3. 多模态 Agent 能力已接近 Opus-4.8,视觉理解任务性能显著提升。

  4. 支持图片描述、文字识别、图表分析等多模态 Agent 实用场景。

思维导图

用一张图看清主题之间的关系。

查看大纲文本(无障碍 / 无 JS 友好)
  • DeepSeek-V4-Flash-Vision-Exp
    • 开源信息
      • MIT License
      • Hugging Face 平台
    • 技术特性
      • 视觉编码器
      • DFlash Attention
      • MoE 架构
    • 能力对比
      • 接近 Opus-4.8
      • 多模态 Agent 性能提升

金句 / Highlights

值得收藏与分享的关键句。

#多模态模型#开源#DeepSeek#Agent#MIT License
打开原文

DeepSeek-V4-Flash-Vision-Exp 模型已开源,多模态 Agent 能力接近 Opus-4.8 · AIHOT

返回

原文

精选

AI 评分 76/100

打开原文

(在新标签页打开)

导出 Markdown

DeepSeek-V4-Flash-Vision-Exp 模型已开源,多模态 Agent 能力接近 Opus-4.8

IT之家(RSS)

·

2026-08-31 19:35

3小时前

AI 导读

DeepSeek 于 8 月 31 日在 Hugging Face 开源首个多模态模型 DeepSeek-V4-Flash-Vision-Exp,采用 MIT License,公开模型文件、Tokenizer、Prompt Encoding 参考实现及最小化 PyTorch 推理实现。

76

AI 编辑部评分,满分 100

· 3小时前

推荐理由

原文梳理了模型开源内容与能力定位,读者可据此评估其在多模态 Agent 场景中的可用性。

正文 · AI 翻译

中文

IT之家 8 月 31 日消息,刚刚,DeepSeek V4 首个多模态模型 DeepSeek-V4-Flash-Vision-Exp 在 Hugging Face 上线,采用 MIT License 开源。

公开内容包括模型文件、Tokenizer、Prompt Encoding 参考实现,以及最小化 PyTorch 推理实现,覆盖视觉编码器、Aligner、DFlash Attention、MoE、Hyper-Connections 与 DSpark 等核心模块。

据IT之家了解,DeepSeek-V4-Flash-Vision-Exp 是 DeepSeek V4 系列首款原生支持图片输入的视觉模型,官方明确标注为“Exp”实验版本,于 2026 年 8 月 21 日上线 DeepSeek API 平台。

该模型支持在文本之外输入图片,可以让模型描述图片、识别截图中的文字、分析图表等。支持的图片格式包括 JPEG、PNG、GIF、WebP。

深度求索官方表示,V4-Flash-Vision-Exp 在各类 Agent 框架内展现出了较好的多模态适配能力,能够有效支持大家借助多样化的 Agent 工具解锁更多实用的工作场景。在 Agent、推理、世界知识等纯文本任务上与 V4-Flash 正式版持平,原有优势完整保留。在需要视觉理解的 Agent 基准测试中较 V4-Flash 大幅提升,多模态 Agent 能力已接近 Opus-4.8。

来源: IT之家(RSS) · ithome.com

智能体

DeepSeek

多模态

开源生态

模型发布