跳到主要内容
赞助推荐 搬瓦工怎么选:三网直连 CN2 GIA-E
赞助推荐 开放可编程的智能路由
赞助推荐 开放可编程的智能路由

标签索引

视觉语言模型

这个标签下有 5 篇文章。按时间回看相关判断与实践记录。

标签精选

相关内容

前沿哨所

基于视觉语言模型:新工具实现卫星图像“文本搜物”与实时分析

这款名为“卫星分析工作区”的演示工具展示了最新的地理空间计算机视觉技术。用户无需注册,即可在高分辨率地图上通过输入“车辆”、“储罐”或“桥梁”等文本提示词,利用视觉语言模型实时检测并识别地面物体。该工具旨在展示其云端推理引擎的速度与精度,虽...

1 分钟阅读119 阅读
前沿哨所

DatBench:革新VLM评估的精准高效工具

实证评估是指导基础模型研究进步的主要指南。尽管大量工作专注于训练前沿视觉语言模型(VLMs),但评估方法仍处于早期阶段。为引导其成熟,研究者提出评估应满足三个关键标准:忠实性(对模态和应用)、可区分性(区分不同质量模型)和效率(计算效率)。...

1 分钟阅读224 阅读
工程实践

AI视觉标注冷启动:零样本解决数据荒

AI视觉标注冷启动:零样本解决数据荒 一、问题 传统标注的三座大山: – 时间成本:万张图片需要数月人工 – 金钱成本:专业标注员时薪$15-50 – 专家依赖:医疗/工业场景需要领域专家 冷启动困境:没...

6 分钟阅读324 阅读
前沿哨所

开源AI助手'肉包Roubao':无需电脑的手机自动化工具

肉包Roubao是一款开源的Android自动化助手,基于视觉语言模型技术,无需连接电脑即可实现手机自动化操作。该项目已在GitHub开源,获得了开发者社区的积极讨论。这款工具将AI技术与移动自动化相结合,为用户提供了一种全新的手机操作方式...

1 分钟阅读378 阅读