跳到主要内容
赞助推荐 Claude Team 合租,少折腾账号
>80aj_
赞助推荐 开放可编程的智能路由
赞助推荐 开放可编程的智能路由

标签索引

视觉理解

这个标签下有 4 篇文章。按时间回看相关判断与实践记录。

标签精选

相关内容

前沿哨所

攻克VLM多图幻觉难题:解析API差异与两阶段工程解法

本文深入探讨了视觉语言模型(VLM)在处理多张图像时面临的“幻觉”挑战,特别是在跨场景三维理解等复杂任务中。研究发现,当输入图片超过一定数量,模型常出现逻辑混乱,且网页端与API调用表现差异显著。文章分析了注意力分散与Token成本之间的矛...

1 分钟阅读241 阅读
思考杂谈

多模态 AI Agent:让 AI 看见、听见、理解世界

传统 AI Agent 只能处理文本。 但现实世界不只有文本,还有图片、音频、视频、传感器数据。 下一代 AI Agent 必须是多模态的。 能力一:视觉理解 让 Agent 能”看”。 应用场景: 图片分析:识别物...

5 分钟阅读264 阅读