会员登录 - 用户注册 - 设为首页 - 加入收藏 - 网站地图 代码、模型全开源!贾佳亚团队多模态模型 Mini-Gemini登上热榜!

代码、模型全开源!贾佳亚团队多模态模型 Mini-Gemini登上热榜

时间:2024-07-02 03:47:27 来源:带水拖泥网 作者:热点 阅读:200次

代码、模型全开源!贾佳亚团队多模态模型 Mini-Gemini登上热榜

CSS站长资源(ChinaZ.com)4月15日 消息:香港中文大学终身教授贾佳亚团队最近推出了一款名为Mini-Gemini的代码多模i登多模态模型,该模型在多模态任务榜单上取得了显著成绩,模型其性能堪比GPT-4与DALLE3的全开结合。

Mini-Gemini模型以其更精确的源贾图像理解能力、更高质量的佳亚训练数据和更强的图像解析推理能力而著称。模型能够结合图像推理和生成,团队态模提供了从2B到34B不同规模的上热版本,其中最强版本在多个指标上与Google Gemini Pro和GPT-4V相比毫不逊色。代码多模i登

项目地址:https://top.aibase.com/tool/mini-gemini

试玩地址: https://103.170.5.190:7860/

Mini-Gemini模型的模型代码、模型和数据已经全部开源,全开可以在Github、源贾论文地址和模型及数据的佳亚Huggingface页面上找到。这一开放性的团队态模举措使得Mini-Gemini迅速登上了PaperWithCode的热榜,受到了广泛关注。上热

Mini-Gemini的代码多模i登图像理解和生成能力通过Demo形式得到了展示,用户可以在线与自定义图像进行对话。这一功能使得Mini-Gemini在实际应用场景中表现出色,尤其是在需要对高清图像进行解析并用图像形式展现的任务中。例如,Mini-Gemini能够根据图片内容对做面包的过程进行指导,也能根据电脑图片中的参数进行准确对比。

此外,Mini-Gemini在保留图像理解和推理能力的同时,还具备了图像生成能力,类似于ChatGPT与生成模型的结合。通过抽象的多模态指令,模型能够进行推理并生成合适的图片。例如,当用户提出两个毛线团能做什么时,Mini-Gemini不仅能识别图片内容并给出建议,还能生成相应的毛线小熊图片。

Mini-Gemini的技术背后,采用了名为Gemini的视觉双分支信息挖掘方法,通过使用卷积网络(ConvNet)对高分辨率图像进行编码,并利用Transformer中的Attention机制来挖掘每个低分辨率Query对应的高分辨率区域。在图像生成方面,Mini-Gemini结合了SDXL技术,通过LLM生成的文本链接两个模型,类似于DALLE3的流程。

在数据方面,Mini-Gemini通过收集和优化训练数据,实现了对图像理解、推理和生成的统一流程。即使在仅使用2-3M数据的情况下,Mini-Gemini也能在各种Zero-shot榜单上与大厂使用大量数据训练出的模型相媲美,展现了其高效性和实用性。这一成果不仅为开源社区带来了新的活力,也为多模态模型的发展和应用开辟了新的可能性。

(责任编辑:业界)

相关内容
  • “奔驰加塞”事件被砸奇瑞车主疑涉嫌套牌 官方通报:未发现问题
  • 苹果CEO库克:Apple智能很强 终于能让我们少刷手机了
  • 宿舍没空调大学生排队领冰块 网友:冰块成避暑新宠
  • 电动自行车停楼道拒不改正 北京两名车主被罚700元
  • 迄今能效量子点太阳能电池面世:能效高达18.1%
  • Redmi K70版工业设计曝光:镜头设计神似小米15
  • 实况照片进一步普及,Find X7/一加12等机型将于ColorOS15内公测
  • 代工厂转型时尚品牌,黄金商家在小红书,3个月做到月销百万
推荐内容
  • AI拜年模拟器“决战拜年之巅”网络走红 快来看看你是不是“大孝子”
  • 中专女生爆冷拿下数学竞赛全球12名:有兴趣的同时还需要努力
  • 我国电视开机率断崖式下跌!套娃收费、开机广告等备受吐槽
  • 小鹏汽车公布小鹏X9用户画像:超8成是BBA增购车主
  • 高铁超载无法运行 有旅客被请下车!12306回应:不建议买短补长
  • 马斯克500亿美元天价薪酬方案通过:90%的散户股东大力支持