跳到主要内容
赞助推荐 Claude Team 合租,少折腾账号
>80aj_
赞助推荐 开放可编程的智能路由
赞助推荐 开放可编程的智能路由

标签索引 / 第 14 页

多模态

这个标签下有 190 篇文章。按时间回看相关判断与实践记录。

标签精选

相关内容

前沿哨所

用户实测:让 ChatGPT 生成图片分析用户的交互态度

V2EX 用户分享了一项有趣的实验,向 ChatGPT 发送指令,要求其基于历史对话生成图片,直观呈现用户对待 AI 的态度且不加粉饰。这一互动不仅展示了 ChatGPT 在多模态生成与长程记忆理解方面的能力,也反映了当前大模型在个性化交互...

1 分钟阅读236 阅读
前沿哨所

格灵深瞳推「丹青」亿级数据集,刷新中文多模态预训练基准

格灵深瞳正式发布名为「丹青」的大规模中文视觉语言预训练数据集。该数据集包含1亿组精选图文配对,基于2024至2025年网络数据构建,具备高时效性与高质量特性。实验显示,基于该数据集训练的模型在零样本分类、跨模态检索及LMM评测中表现显著优于...

1 分钟阅读323 阅读
前沿哨所

Gemini看图+Suno V5写歌:AI音乐生成的创意与槽点

本文记录了利用Gemini分析图像并生成提示词,再由Suno V5创作音乐的第三期实验。作者展示了多首风格各异的作品,从怀旧青春到悬疑特工,并深入点评了Suno V5在编排上的惊艳表现及混音质量的不稳定性。特别是关于“华为版”与“苹果版”的...

1 分钟阅读244 阅读
前沿哨所

黑马AI大模型三期出炉:涵盖RAG、Agent与多模态全栈教程

本次资源公开了“黑马AI大模型第三期”的完整课程体系,内容涵盖从Python基础到高级大模型开发的全方位知识。课程分为六个阶段,重点讲解大模型应用工具、Prompt工程、Agent开发、LangChain框架以及多模态技术。此外,包含金融、...

1 分钟阅读381 阅读
前沿哨所

Gemini 多图识别逻辑现反转 Bug:最后上传被视为第一张

近期测试发现,Google Gemini 在处理多图上传时存在逻辑反转问题。当用户上传多张图片时,Gemini 会将最后上传的图片视为第一张,与用户直觉相悖。相比之下,Grok、豆包和 Claude 均能正确识别图片顺序。值得注意的是,如果...

1 分钟阅读248 阅读
前沿哨所

阿里发布Qwen3-VL多模态模型,革新检索技术

2026年1月8日,阿里Qwen团队推出Qwen3-VL-Embedding和Qwen3-VL-Reranker,首批基于Qwen3-VL的开源多模态嵌入与重排序模型。这些模型统一处理文本、图片、截图、视频及混合模态输入,映射到高维语义空间...

1 分钟阅读260 阅读