用户实测:让 ChatGPT 生成图片分析用户的交互态度
V2EX 用户分享了一项有趣的实验,向 ChatGPT 发送指令,要求其基于历史对话生成图片,直观呈现用户对待 AI 的态度且不加粉饰。这一互动不仅展示了 ChatGPT 在多模态生成与长程记忆理解方面的能力,也反映了当前大模型在个性化交互...
标签索引 / 第 14 页
这个标签下有 190 篇文章。按时间回看相关判断与实践记录。
标签精选
V2EX 用户分享了一项有趣的实验,向 ChatGPT 发送指令,要求其基于历史对话生成图片,直观呈现用户对待 AI 的态度且不加粉饰。这一互动不仅展示了 ChatGPT 在多模态生成与长程记忆理解方面的能力,也反映了当前大模型在个性化交互...
Y Combinator孵化项目Channel3致力于构建全球互联网产品数据库,旨在解决AI代理商业化中的数据混乱难题。公司利用多模态AI技术理解产品页面,已索引超1亿产品,服务1500多名开发者。Channel3目标成为AI交易的基础设施...
全能 AI 聊天助手 AMC(All-Model-Chat)发布重大功能更新。新版本支持完整呈现 Gemini 的原始思维链,为开发者提供了观测模型逻辑推导过程的窗口,增强了可解释性。同时,新增的半篡改续写功能允许用户在 AI 生成过程中进...
格灵深瞳正式发布名为「丹青」的大规模中文视觉语言预训练数据集。该数据集包含1亿组精选图文配对,基于2024至2025年网络数据构建,具备高时效性与高质量特性。实验显示,基于该数据集训练的模型在零样本分类、跨模态检索及LMM评测中表现显著优于...
本文记录了利用Gemini分析图像并生成提示词,再由Suno V5创作音乐的第三期实验。作者展示了多首风格各异的作品,从怀旧青春到悬疑特工,并深入点评了Suno V5在编排上的惊艳表现及混音质量的不稳定性。特别是关于“华为版”与“苹果版”的...
本次资源公开了“黑马AI大模型第三期”的完整课程体系,内容涵盖从Python基础到高级大模型开发的全方位知识。课程分为六个阶段,重点讲解大模型应用工具、Prompt工程、Agent开发、LangChain框架以及多模态技术。此外,包含金融、...
谷歌基于Gemma 3架构推出TranslateGemma开源翻译模型系列,包含4B、12B和27B三种参数规模,支持55种语言及多模态图像翻译。测试显示,TranslateGemma 12B性能超越参数量翻倍的27B基线模型,而4B小模型...
近期测试发现,Google Gemini 在处理多图上传时存在逻辑反转问题。当用户上传多张图片时,Gemini 会将最后上传的图片视为第一张,与用户直觉相悖。相比之下,Grok、豆包和 Claude 均能正确识别图片顺序。值得注意的是,如果...
Gemini作为多模态AI模型,可直接通过垫图生成细节完善的海报,避免复杂的提示词工程。GitHub工具’banana-prompt-quicker’支持一键插入提示词和参考图,提升效率。实用技巧:添加’...
2026年1月8日,阿里Qwen团队推出Qwen3-VL-Embedding和Qwen3-VL-Reranker,首批基于Qwen3-VL的开源多模态嵌入与重排序模型。这些模型统一处理文本、图片、截图、视频及混合模态输入,映射到高维语义空间...