新闻详情

生成式AI多模态大模型再获突破,视觉理解能力逼近人类水平

2025年7月,OpenAI与DeepMind分别发布了各自的多模态大模型最新版本,在VQAv2和MMBench等权威测试中得分首次超过人类基线。新模型采用统一的Transformer架构,能够同时处理文本、图像、音频和视频数据,实现端到端的跨模态理解。

业内专家表示,这一进展将极大推动智能客服、自动驾驶和医疗影像分析等领域的应用落地。模型参数规模已突破万亿级别,但推理效率较上一代提升了30%。开源社区也迅速跟进,推出了轻量化微调方案,降低了企业使用门槛。

← 上一篇
晶雾网络成立内部创新实验室,整合研发资源打造弹性技术框架
下一篇 →
量子计算迈入千比特时代,纠错技术实现里程碑式突破
📞
🏢
💬