
日本DeepSeek公司于2026年8月21日发布了其最新的多模态AI模型“DeepSeek-V4-Flash-Vision-Exp”,该模型首次支持图像输入,能够同时处理文本和图像数据。该模型已集成到DeepSeek API平台,使用费用与现有的DeepSeek V4 Flash保持一致,图像输入的计费上限为每张384个令牌(tokens)。目前该模型仍处于实验阶段,尚未决定是否公开权重。
DeepSeek-V4-Flash-Vision-Exp在文本处理能力方面与DeepSeek V4 Flash相当,支持文本推理、知识查询和智能代理功能,最大上下文长度为100万令牌,最大输出令牌数为384,000。唯一的性能轻微下降是在安全基准测试“Cybergym”中,分数从76.7降至75.3。
该模型在多模态智能代理的评测中表现出色,在四项评测指标中有两项超过了Anthropic的“Claude Opus 4.8”。具体表现为智能代理考试(Agents' Last Exam)得分27.3对25.7,图像理解测试ZeroBench(Pass@5)得分35.0对34.0。
为了控制成本,DeepSeek对所有输入图像进行自动缩放处理,保持纵横比,将大图像缩小至800×800像素以内,确保每张图像的令牌消耗不超过384。无论上传多高分辨率的图片,单张图像的计费不会增加。
计费标准与DeepSeek V4 Flash相同,输入100万令牌收费0.22美元(约合35日元,汇率1美元=159日元),输出100万令牌收费0.66美元(约合105日元)。以上价格为非高峰时段,繁忙时段价格将翻倍。
图像上传方式支持三种:一是将本地图片转换为Base64编码直接嵌入;二是提供公开URL,由模型端下载;三是通过同日上线的“Files API”预先上传。Files API免费,支持单文件最大64MB,上传后可通过file_id多次调用,单次请求最多支持600张图片。
值得一提的是,DeepSeek V4 Flash的正式版本已于2026年7月31日在日本MIT许可下于Hugging Face平台免费发布。至于本次发布的DeepSeek-V4-Flash-Vision-Exp模型权重是否公开,目前尚无明确消息。


