一则短视频内容称,DeepSeek V4.1预计将在6月发布,本次升级的重点,是补齐此前版本在多模态能力上的短板。

图片来源于网络,版权归原作者所有,侵权请联系删除
从纯文本走向多模态理解
视频中提到,V4预览版主要支持纯文本交互,而V4.1将原生集成图像理解与音频理解能力,让模型不再只依赖文字输入。
这意味着,用户给出图片、语音、视频等更复杂的信息时,AI有望同时理解画面、声音与语义之间的关系。
核心变化不是多了几个输入入口,而是模型理解世界的方式更接近真实交流场景。
图像、语音、视频都可能成为上下文
按照视频中的说法,新版本将能够“看图文领会梗背后的情绪”,也能“听语音识别语意与情绪”,还可以在视频中理解画面与声音的关联内容。
如果这些能力最终落地,DeepSeek V4.1的使用场景会明显扩展:例如根据草图生成执行方案,结合语音情绪判断沟通意图,或从视频素材中提炼更完整的信息。
补齐的是能力,也是沟通语言
多模态能力的价值,不只是让AI“能看、能听、能读视频”,更重要的是让不同模态的信息汇合到同一个理解框架中。
当文字、图像、声音和视频都能成为上下文,AI与人的沟通就会从单点指令,逐步走向更自然的共同语境。
需要注意的是,以上内容来自短视频转述,具体发布时间、功能范围和最终表现,仍应以官方发布信息为准。
文章版权声明:文章内容均来源于各大短视频平台搜集以及修改和删减新增,如有侵权或者违规,请联系站长进行删除,如需转载或复制请以超链接形式并注明出处。

还没有评论,来说两句吧...