你已经是个“成熟的AI”,可以帮我代肝了:智谱AI联合清华大学团队打造视觉大模型CogAgent:可提供《原神》教学辅助

2025-02-20 来源|AI图库吧

AI奇点网1月2日报道丨近日,清华大学的 KEG 实验室与旗下孵化的人工智能创企智谱 AI 合作,联合推出了新一代视觉GUI Agent图像理解大模型 CogAgent。这款产品在几个月前曾经在圈内引发了小轰动。

所谓的视觉GUI Agent,就是通过大模型参与大规模的图像内容训练,使之可以替代人类完成指定的代理操作的一种大模型技术。

长期对人类行为进行研究发现,人类是通过视觉与GUI交互的。比如,面对一个网页,当给定一个操作目标时,人类会先观察他的GUI界面,然后决定下一步做什么,而不是去扒它冗长的HTML源码。GUI界面天然是为了人类便捷而设计的。也就是说,在GUI场景下,视觉是一种更为直接、本质的交互模态,能更高效完整提供环境信息。

CogAgent就是这样一款基于视觉的GUI Agent。下面的示例展现了其工作路径与能力。用户只需把操作目标“search for the best paper in CVPR 2023”连同当前截图一起丢给模型,CogAgent就能预测出详细的动作,甚至能够把操作元素的精准定位也一同输出!

该模型基于此前推出的 CogVLM,通过视觉 GUI Agent,使用视觉模态(而非文本)对 GUI 界面进行更全面直接的感知,从而作出规划和决策。

CogAgent 可以接受 1120×1120 的高分辨率图像输入,具备视觉问答、视觉定位(Grounding)、GUI Agent 等多种能力,在 9 个经典的图像理解榜单上(包括 VQAv2.STVQA,DocVQA,TextVQA,MM-VET,POPE 等)取得了通用大模型能力第一名的成绩。

例如,用户输入一张关于 CogVLM 项目的 GitHub 的图片,然后询问如何给这个项目点“Star”,然后 CogAgent 就会反馈出结果。

例如用户输入一张原神游戏的截图,可以询问“当前任务中的队友是谁?”,CogAgent 会给出相关的回答。

AI大模型能”看懂“游戏界面上展示的GUI信息。具体来说,翻译过来大概是这样的:

用户:Who are the teammates on the current mission? (当前任务中的队友是谁?)

最新
更多

你已经是个“成熟的AI”,可以帮我代肝了:智谱AI联合清华大学团队打造视觉大模型CogAgent:可提供《原神》教学辅助

日,清华大学与旗下孵化的人工智能创企智谱AI合作,联合推出了新一代视觉GUI Agent图像理解大模型 CogAgent,可告知《原神》游戏操作步骤等

“情绪价值”带火AI陪伴机器人 大厂创业者、头部机构“跑步入场”

《科创板日报》2月2日讯(记者 陈美)自从AI陪伴机器人在2025年CES展火了之后,一批AI陪伴小机器人凭借可爱呆萌的形象,火速出圈。特别是日本企业推出的一款毛茸茸小机器人——钱包妖精,受到了很多女性消费者的喜

【腾讯云AI绘画使用教学】深入了解腾讯云的AI绘画工具,并实际应用于图像生成工作流丨赠送免费生成次数福利

近日,由中国信通院开展的“AIGC绘画平台基础能力评估”结果发布,腾讯云AI绘画成为国内首批通过该评估标准的AIGC绘画平台。

法媒:AI峰会将为欧洲敲响“警钟”

法国将于2月10日至11日在巴黎举办人工智能(AI)行动峰会。法新社4日称,来自80个国家和地区以及行业内的代表将齐聚法国首都,该峰会旨在为正在应对来自美国和中国人工智能挑战的欧洲敲响“警钟”。 法国24电视台

AI绘画越来越逼真,却越来越容易抄袭?Midjourney V6引发全网激辩:生成图像涉嫌版权侵权,开发商拒不承认

MidjourneyV6新版本引争议,曾与漫威、DC等知名电影大厂合作概念设计的美国知名艺术家Reid Southen发文表示,生成的图像与多部电影中的场景几乎一模一样。

DeepSeek突破性进展提振AI产业信心,推动AI应用、AI端侧创新加速

据报道,上线20天,DeepSeek日活已突破2000万,创下了又一项新纪录。此前,DeepSeek在140个市场的移动应用下载量排行榜上位居榜首。根据国内AI产品榜统计,DeepSeek应用(不包含网站数据)上线5天日活就已超过Cha

网站地图