科技

DeepSeek V4 多模态开源,我们把它的视觉链路拆了一遍

来源:雷峰网 · 2026-09-01 21:00
DeepSeek V4 多模态开源,我们把它的视觉链路拆了一遍

图片不只被编码,还直接参与 Attention、MoE 与 Agent 推理。    作者丨郑佳美    编辑丨岑   峰                                                                                                       这不是一个全新的模型突然出现。早在 8 月 21 日,DeepSeek 就已经把它接入 API,当时外界只能看到结果:V4 开始能处理图片,而且在 ApexBench、Agents' Last Exam、Chartography 等多模态 Agent 基准上整体提升。现在不一样了。随着权重和参考推理代码公开,V4 的视觉部分第一次可以直接拆开看。Vision Encoder 怎么处理图片,Aligner 怎么把视觉特征压进语言空间,视觉 Token 怎么进入 DFla

原文:雷峰网

← 返回首页