跳到主要内容
赞助推荐 Claude Team 合租,少折腾账号
>80aj_
赞助推荐 开放可编程的智能路由
赞助推荐 开放可编程的智能路由

标签索引 / 第 13 页

多模态

这个标签下有 190 篇文章。按时间回看相关判断与实践记录。

标签精选

相关内容

前沿哨所

全AI编写!本地多模态搜索工具小遥搜索正式开源

开发者开源了本地 AI 搜索桌面应用“小遥搜索”。该工具支持语音、文本、图片等多模态输入,完全在本地运行以确保数据隐私。项目最显著的特点是从零开始完全通过 Vibe Coding(AI 辅助编程)实现。技术架构上,集成了 BGE-M3、Ol...

1 分钟阅读213 阅读
前沿哨所

OpenAI 推出全新科研工具 Prism:集成多模态能力

OpenAI 悄然发布了一款名为 Prism 的全新科研工具,目前已开放访问。该工具集成了对话交互、图像识别(包含公式识别)以及语音模式等多种功能,显示出强大的多模态处理能力。尽管早期反馈显示其界面设计较为粗糙,但这通常意味着工具仍处于早期...

1 分钟阅读234 阅读
前沿哨所

开源AI漫画编辑器:Gemini/Kimi全自动翻译嵌字

开发者开源了一款名为 MangaType Live 的 AI 漫画编辑器,通过调用具备视觉能力的 LLM(如 Gemini、Kimi)实现全自动翻译与嵌字。该项目摆脱了传统机翻软件繁琐的调整过程,利用多模态 AI 替代了高负载的专用模型。测...

1 分钟阅读409 阅读
前沿哨所

Kimi官网升级K2.5:多模态能力比肩Gemini,综合实力强劲

Kimi官网已悄然更新,原有的K2及K2思考模型被全新的K2.5版本取代。用户反馈显示,K2.5在大部分真实应用场景中,能力已达到GPT和Gemini等顶尖模型的水准。特别是全新加入的多模态能力,表现尤为亮眼,被评价为等于或超越Gemini...

1 分钟阅读270 阅读
前沿哨所

DeepSeek悄然解锁多模态能力,实测已支持图像识别

DeepSeek在近期更新中悄然上线了多模态能力。经用户测试,DeepSeek App及网站现已能够识别并理解图片内容,如准确辨认物体等。这一更新标志着DeepSeek从纯文本模型向图文结合的多模态AI迈进,补齐了其在视觉感知方面的短板,使...

1 分钟阅读288 阅读
前沿哨所

全能AI助手AMC更新:支持Markdown转PDF与富文本粘贴

开源AI工具AMC发布重要更新,深度集成Gemini生态。新版本支持将带网络图片的Markdown转换为PDF,并实现网页富文本与本地文件的直接粘贴。该工具具备多模态交互、联网搜索、代码执行及长文档分析能力,结合Gemini的视觉与文字双重...

1 分钟阅读159 阅读