2025年7月,OpenAI与DeepMind分别发布了各自的多模态大模型最新版本,在VQAv2和MMBench等权威测试中得分首次超过人类基线。新模型采用统一的Transformer架构,能够同时处理文本、图像、音频和视频数据,实现端到端的跨模态理解。
业内专家表示,这一进展将极大推动智能客服、自动驾驶和医疗影像分析等领域的应用落地。模型参数规模已突破万亿级别,但推理效率较上一代提升了30%。开源社区也迅速跟进,推出了轻量化微调方案,降低了企业使用门槛。
2025年7月,OpenAI与DeepMind分别发布了各自的多模态大模型最新版本,在VQAv2和MMBench等权威测试中得分首次超过人类基线。新模型采用统一的Transformer架构,能够同时处理文本、图像、音频和视频数据,实现端到端的跨模态理解。
业内专家表示,这一进展将极大推动智能客服、自动驾驶和医疗影像分析等领域的应用落地。模型参数规模已突破万亿级别,但推理效率较上一代提升了30%。开源社区也迅速跟进,推出了轻量化微调方案,降低了企业使用门槛。