跳到主要内容
赞助推荐 Claude Team 合租,少折腾账号
>80aj_
赞助推荐 开放可编程的智能路由
赞助推荐 开放可编程的智能路由

标签索引

多模态大模型

这个标签下有 31 篇文章。按时间回看相关判断与实践记录。

标签精选

相关内容

前沿哨所

即梦AI短片创作全流程教程:集成DeepSeek与多模态大模型实战

本资源汇集了即梦AI短片创作的全套视频教程,共计50余个课时,内容涵盖从基础界面操作到高级模型应用的完整闭环。课程亮点不仅包括提示词工程、图生图、智能画布及AI音乐生成等技术细节,更深度结合了DeepSeek智能体植入与多模态大模型的前沿应...

1 分钟阅读109 阅读
前沿哨所

探索AI代理新范式:纯视觉方案能否成为通用终端的终极解法?

当前AI代理的开发往往受限于API接口、UI结构或底层组件的差异性,导致每切换一个软件环境就需要重新设计任务路径,开发成本高昂且通用性极差。针对这一痛点,有技术社区提出了“纯视觉方案”的设想,即仅通过屏幕截图、OCR识别、图像理解配合键鼠模...

1 分钟阅读60 阅读
前沿哨所

展现“医生级”细节捕捉力,DeepSeek多模态能力获实测好评

来自社区的实测案例显示,DeepSeek在视觉多模态领域展现出惊人潜力,特别是在处理胸部CT扫描等复杂医学影像时,表现出类似专业医生的细致观察力。用户反馈称,该模型不仅能识图,更能精准捕捉影像中的细微病灶与解剖结构。这一突破表明DeepSe...

1 分钟阅读73 阅读
前沿哨所

多模态大模型“团战”失败?手写菜单识别竟成顶级AI的软肋

一则来自技术社区的帖子引发了广泛关注,该测试揭示了主流多模态大模型在特定场景下的实际短板。测试要求模型从包含复杂手写数字和勾选标记的菜单图片中,精准提取菜品名与数量,并强制输出为无Markdown干扰的YAML格式。结果显示,包括GLM-5...

1 分钟阅读81 阅读