DeepSeek V4.1倒计时:多模态能力或成关键补齐

刘波

一则短视频内容称,DeepSeek V4.1预计将在6月发布,本次升级的重点,是补齐此前版本在多模态能力上的短板。

DeepSeek V4.1倒计时:多模态能力或成关键补齐

图片来源于网络,版权归原作者所有,侵权请联系删除


从纯文本走向多模态理解

视频中提到,V4预览版主要支持纯文本交互,而V4.1将原生集成图像理解音频理解能力,让模型不再只依赖文字输入。

这意味着,用户给出图片、语音、视频等更复杂的信息时,AI有望同时理解画面、声音与语义之间的关系。

核心变化不是多了几个输入入口,而是模型理解世界的方式更接近真实交流场景。

图像、语音、视频都可能成为上下文

按照视频中的说法,新版本将能够“看图文领会梗背后的情绪”,也能“听语音识别语意与情绪”,还可以在视频中理解画面与声音的关联内容。

如果这些能力最终落地,DeepSeek V4.1的使用场景会明显扩展:例如根据草图生成执行方案,结合语音情绪判断沟通意图,或从视频素材中提炼更完整的信息。

补齐的是能力,也是沟通语言

多模态能力的价值,不只是让AI“能看、能听、能读视频”,更重要的是让不同模态的信息汇合到同一个理解框架中。

当文字、图像、声音和视频都能成为上下文,AI与人的沟通就会从单点指令,逐步走向更自然的共同语境。

需要注意的是,以上内容来自短视频转述,具体发布时间、功能范围和最终表现,仍应以官方发布信息为准。

文章版权声明:文章内容均来源于各大短视频平台搜集以及修改和删减新增,如有侵权或者违规,请联系站长进行删除,如需转载或复制请以超链接形式并注明出处。

发表评论

快捷回复: 表情:
AddoilApplauseBadlaughBombCoffeeFabulousFacepalmFecesFrownHeyhaInsidiousKeepFightingNoProbPigHeadShockedSinistersmileSlapSocialSweatTolaughWatermelonWittyWowYeahYellowdog
验证码
评论列表 (暂无评论,16人围观)

还没有评论,来说两句吧...

目录[+]