谷歌近日发布T5Gemma 2,这是基于Gemma 3架构的新一代编码器-解码器模型。相比前代产品,T5Gemma 2引入了多项架构创新,包括绑定的词嵌入和合并的注意力机制,显著减少了模型参数量。新模型支持多模态处理能力,能够同时理解和处理图像与文本;上下文窗口扩展至128K tokens,大幅提升长文本处理能力;支持140多种语言,具有强大的多语言处理能力。性能测试显示,T5Gemma 2在多模态、长上下文、编码和推理等任务上均超越前代产品。该系列提供270M-270M、1B-1B和4B-4B三种规模的预训练模型,适用于设备端应用和下游任务开发。目前模型已在Kaggle、Hugging Face等平台开放下载,为AI研究者和开发者提供了强大的新工具。
谷歌发布T5Gemma 2:新一代多模态长上下文编码器-解码器模型
未经允许不得转载:80aj » 谷歌发布T5Gemma 2:新一代多模态长上下文编码器-解码器模型
相关推荐
开源神器上架:利用多模态大模型API实现网页图片“沉浸式”翻译
DeepSeek多模态能力实锤?用户反馈识图功能灰度范围扩大
AI 学习神器 LearnSmart:支持 B 站/播客多模态输入,打造沉浸式知识库
实测 Google AI Studio 视频功能:Pro 账号疑似受限,多模态或成 Ultra 专属
大模型多模态实测:DeepSeek在象棋OCR识别中“翻车”,Gemini完胜
DeepSeek 视觉模型实测:地图与图像联想能力表现出色,多模态比拼 Gemini
低成本模型也能看图:利用OCR为DeepSeek等非多模态模型赋予视觉能力
Qwen 3.6 Plus 实测表现:手写识别能力碾压 GPT,但 AI 为什么总爱“加戏”?