时政
财经
科技
虚拟货币
其他
登录
#视觉推理模型
关注
sitin
14小时前
智谱发布并开源了全球100B级效果最佳的开源视觉推理模型GLM-4.5V,总参数106B,激活参数12B。 模型基于智谱新一代文本基座模型GLM-4.5-Air,综合效果在41个公开视觉多模态榜单中达到SOTA水平,支持图像、视频、文档理解及GUI Agent等任务。 具备覆盖不同种视觉内容的处理能力,实现全场景视觉推理,包括: ·图像推理(场景理解、复杂多图分析、位置识别) ·视频理解(长视频分镜分析、事件识别) ·GUI 任务(屏幕读取、图标识别、桌面操作辅助) ·复杂图表与长文档解析(研报分析、信息提取) ·Grounding 能力(精准定位视觉元素)
智谱直播发布全球最佳视觉模型GLM-4.5V,挑战AI视觉领域极限· 3 条信息
#智谱
#GLM-4.5V
#开源
#视觉推理模型
#多模态
分享
评论 0
0
个人主页
通知
我的投稿
我的关注
我的拉黑
我的评论
我的点赞