会员登录 - 用户注册 - 设为首页 - 加入收藏 - 网站地图 谷歌发布开源视觉语言模型PaliGemma 支持多视觉语言任务!

谷歌发布开源视觉语言模型PaliGemma 支持多视觉语言任务

时间:2024-07-04 04:57:18 来源:带水拖泥网 作者:电商 阅读:645次

谷歌发布开源视觉语言模型PaliGemma 支持多视觉语言任务

CSS站长资源(ChinaZ.com)5月17日 消息:谷歌推出了一款名为PaliGemma的谷歌开源视觉语言模型,该模型结合了图像处理和语言理解的发布能力,旨在支持多种视觉语言任务,开源如图像和短视频字幕生成、视觉视觉视觉问答、语言语图像文本理解、模型物体检测、持多文件图表解读以及图像分割等。任务

PaliGemma的谷歌关键特点:

  • 多任务支持:PaliGemma能够处理多种视觉语言相关的任务,提供广泛的发布应用场景。

  • 参数规模:该模型包含30亿(3B)个参数,开源是视觉视觉一个大型的多模态模型。

  • 模型架构:PaliGemma结合了SigLiP视觉编码器和Gemma语言模型,语言语分别负责处理图像和文本输入。模型

SigLiP视觉编码器:

负责处理图像输入,持多将视觉信息编码为模型能够理解的格式。

Gemma语言模型:

负责处理文本输入,并生成输出,将图像内容与语言任务结合起来。

PaliGemma的发布是谷歌在AI领域的又一项重要贡献,它不仅推动了视觉语言理解技术的发展,也为研究人员和开发者提供了强大的工具,以探索和创造新的应用。开源的特性意味着PaliGemma可以被社区广泛地使用、改进和集成到各种产品和服务中。

模型地址:https://huggingface.co/blog/paligemma

(责任编辑:业界)

相关内容
  • 华为鸿蒙星河版来了 华为提醒开发者2月下旬推送升级 注意保密!
  • 调查:超半数英国大学生使用AI完成学业
  • 腐乳变“东方奶酪”:在海外卖爆了
  • 第42年春晚,这些商业顶流重回C位
  • 苹果屏使用时间设置继续失灵 网友吐槽一周失灵好几次
  • 1800元的机票退票收1500手续费 南航免费退改为何这么难
  • 首播十分钟观众破百万!《英雄联盟》抖音直播今起全面开放
  • Comfyspace插件更新 新增模型管理功能
推荐内容
  • 狂赚13亿流水的《幻兽帕鲁》,让“打工人”狠狠共情了?
  • 英国政府推出超过 1 亿英镑的计划来启动“负责任的”人工智能研发
  • 厉害了!三星的电池保护功能升级了
  • iPhone AI图像编辑P图app工具免费在线使用地址 苹果MGIE开源模型官网体验入口
  • 高速服务区充电1小时花99元 官方回应:价格按标准执行 当时是高峰期
  • 文旅局长带着锅和煤气罐赶到高速口 为滞留旅客提供暖心食物