攻克VLM多图幻觉难题:解析API差异与两阶段工程解法
本文深入探讨了视觉语言模型(VLM)在处理多张图像时面临的“幻觉”挑战,特别是在跨场景三维理解等复杂任务中。研究发现,当输入图片超过一定数量,模型常出现逻辑混乱,且网页端与API调用表现差异显著。文章分析了注意力分散与Token成本之间的矛...
标签索引 / 第 7 页
这个标签下有 190 篇文章。按时间回看相关判断与实践记录。
标签精选
本文深入探讨了视觉语言模型(VLM)在处理多张图像时面临的“幻觉”挑战,特别是在跨场景三维理解等复杂任务中。研究发现,当输入图片超过一定数量,模型常出现逻辑混乱,且网页端与API调用表现差异显著。文章分析了注意力分散与Token成本之间的矛...
谷歌AI负责人Logan Kilpatrick正式发布了代号为“Gemini 3.1 Flash Live”的新模型。这是一款专为构建具备实时语音和视觉能力的AI Agent而打造的底层技术。据官方透露,团队在过去一年多时间里,专注于模型架...
VoxSight 是一款基于 Google Gemini 多模态技术的 Chrome 扩展,通过语音指令实现对网页的精准操控。用户只需说出“点击搜索”等命令,扩展即可利用截屏分析技术,通过 AI 理解界面并模拟点击、滚动等操作。该工具采用 ...
科技论坛Linux.do推荐了一款名为“魔因漫创”的开源AI影视生产级工具。该软件基于Electron框架,支持Windows和Mac系统本地部署,实现了从剧本到成片的端到端自动化流程。核心功能方面,它集成了Seedance 2.0多模态大...
一款基于 Uni-1 模型的在线 AI 图像生成平台近日在 V2EX 上引起关注。该模型主打多模态推理能力,尤其在空间理解方面表现出色,能够精准处理物体位置与场景布局。Uni-1 支持参考图可控生成与风格编辑,相比传统模型,它在理解 mem...
MiniMax 工程负责人 Skyler Miao 近日透露,MiniMax 2.7 模型预计将在两周内正式开源权重,团队目前正进行最后迭代,其在 OpenClaw 基准测试中表现优异。针对下一代模型 M3,官方明确将具备原生多模态视觉能力...
小米悄然发布MiMo-V2-Pro和MiMo-V2-Omni两款模型,定位于Agent时代旗舰基座。实测数据显示,Pro版在Agent任务、工具调用及长文本编码上表现惊人,跑分逼近Claude Opus 4.6与GPT-5系列,且性价比优势...
热门开源 AI 客户端 Cherry Studio 近日因核心功能缺陷引发社区强烈不满。用户指出,从 v1.7.19 版本开始,软件在处理多模态 PDF 时出现严重倒退(Regression),包括强制剔除 PDF 内图片、超过 10MB ...
OpenAI 推出了高精度轻量级模型 GPT-5.4 Mini 和 Nano,专为低延迟、高性价比的“多模型协同智能体工作流”量身打造。其中,Mini 模型在编程、多模态及计算机操作能力上拥有旗舰级 90% 以上的实力,但价格仅为旗舰版的 ...
Antfly 是一款基于 Go 语言构建的分布式搜索引擎,旨在为 AI 时代提供统一的数据基础设施。该项目创新性地融合了全文检索(BM25)、向量相似度匹配与图遍历查询能力,支持文本、图像及音视频等多模态数据的自动索引与向量化。其核心亮点在...