会员登录 - 用户注册 - 设为首页 - 加入收藏 - 网站地图 谷歌发布可读屏AI模型ScreenAI:可理解用户界面和信息图表!

谷歌发布可读屏AI模型ScreenAI:可理解用户界面和信息图表

时间:2024-07-02 03:39:18 来源:带水拖泥网 作者:电商 阅读:986次

谷歌发布可读屏AI模型ScreenAI:可理解用户界面和信息图表

**划重点:

**

1. 🌐 **ScreenAI引领AI界新趋势:** 谷歌研究推出ScreenAI,谷歌该AI模型能理解用户界面和信息图表,发布刷新各项任务的可读性能指标,包括根据信息图表回答问题、型S息图总结内容以及导航用户界面。理解

2. 🧠 **技术创新:** ScreenAI采用新颖的用户截图文本表示方法,通过识别UI元素的界面类型和位置,利用Google LLM PaLM2-S生成合成训练数据,和信使模型能够回答关于屏幕信息、谷歌屏幕导航和总结屏幕内容的发布问题。

3. 🚀 **未来展望与挑战:** 尽管ScreenAI在改善对数字内容理解方面取得了一定进展,可读但模型尚不能执行生成的型S息图操作。研究人员表示,理解尽管该专用模型在其类别中表现最佳,用户但在与更大型模型(如GPT-4和Gemini)的界面某些任务上仍需进一步研究,以推动其实际应用的发展。

CSS站长资源(ChinaZ.com)3月5日 消息:谷歌研究最新发布的ScreenAI标志着语言和语音控制计算机界面的又一重要进展。这一AI模型不仅能理解用户界面和信息图表,而且在回答基于信息图表的问题、总结内容以及导航用户界面等多项任务上,创下了新的性能标杆。

ScreenAI的核心创新在于对截图的文本表示方法。该模型能够识别UI元素的类型和位置,这一方法使用了Google LLM PaLM2-S生成的合成训练数据,使其能够回答关于屏幕信息、屏幕导航和总结屏幕内容的问题。

为实现这一创新,ScreenAI将谷歌先前的技术进展,如PaLI架构和Pix2Struct的灵活修补机制,相结合。后者根据宽高比将图形分割为可变网格。ScreenAI通过图像编码器和多模态编码器处理图像和文本输入,然后使用自回归解码器生成文本输出。

研究人员进行的实验证明,模型性能随着模型大小的增加而提高。这表明通过扩大模型规模,可以进一步提升性能。与类似规模的模型相比,ScreenAI在各项基准测试中表现最佳,通常超过更大型模型。此外,使用光学字符识别(OCR)从截图中提取文本内容对模型性能有轻微积极影响。

然而,尽管ScreenAI在数字内容理解方面取得了一定里程碑,但模型尚不能执行生成的操作。研究人员指出,尽管目前有一些在智能手机上运行的语言模型,但缺乏更强大的多模态模型,这些模型可以结合文本、图像、音频和视频。他们预测,随着像ScreenAI这样的模型的发展,仅使用自然语言对智能手机和用户界面进行自动化处理将在不久的将来变得更加先进。

研究人员强调,虽然他们的专用模型在其类别中是最佳的,但在某些任务上仍需要进一步研究,以缩小与更大型模型(如GPT-4和Gemini)的差距。为鼓励更多的发展,谷歌研究计划发布ScreenAI的评估数据集,其中ScreenQA已经提供了包含36,000张截图的86,000个问答对;更复杂的变体和包含截图及其文本描述的集合将会推出。

(责任编辑:热点)

相关内容
  • 高德、百度地图的红绿灯读秒是怎么“算”出来的?
  • 万兴天幕大模型4月28日公测 文生视频支持60秒+内容
  • “疯狂小杨哥”入局短剧,抖音一哥不卖货了?
  • 雷军回应模仿乔布斯、马斯克:蒙受了不白之冤
  • 全年净利润101亿美元!通用汽车公布2023年财报
  • Meta AI官网体验入口 AI助手全功能使用指南方法教程介绍
  • 微信腾讯系快来了!华为:希望今年中国市场99%应用迁移鸿蒙 跟苹果安卓抗衡
  • 最流畅的华为系统!Pura 70系列全球首发鸿蒙4.2
推荐内容
  • 谷歌的Bard在聊天机器人排名中击败了GPT-4
  • ChatGPT火了以后,一个值钱的运营,需要具备的6个能力。
  • 华为:Pura 70标准版不支持星闪 Pro/Pro +/Ultra标配
  • 特斯拉Cybertruck儿童车4月23日发售:LED大灯、续航19公里
  • “云养老”的年轻人,再次爱上鉴宝直播
  • 车圈顶流网红!雷军直播两小时涨粉近89万