AI效率工具SnapMind更新:修复多项Bug,拟推多模态图像处理功能
开发者发布了 AI 文本处理工具 SnapMind 的更新版本,重点修复了使用 Azure OpenAI 模型时的对话异常问题,并解决了 Windows 桌面图标显示及系统托盘主题适配的 Bug。该软件主打一键调用大模型进行文档总结与翻译,...
标签索引 / 第 11 页
这个标签下有 190 篇文章。按时间回看相关判断与实践记录。
标签精选
开发者发布了 AI 文本处理工具 SnapMind 的更新版本,重点修复了使用 Azure OpenAI 模型时的对话异常问题,并解决了 Windows 桌面图标显示及系统托盘主题适配的 Bug。该软件主打一键调用大模型进行文档总结与翻译,...
本文记录了一次针对Gemini、ChatGPT、豆包等五款主流AI模型的实战测评。在“将纸质表格照片转换为通知文本”这一真实办公场景中,大多数模型暴露了数据错位或幻觉问题。其中,字节跳动的豆包表现最为惊艳,它不仅完成了OCR识别,更通过逻辑...
字节跳动正式发布了旗下新一代多模态大模型Seedance 2.0。该模型采用了业内领先的多模态音视频联合生成架构,打破了单一模态的限制,全面支持文字、图片、音频及视频四种模态的输入与生成。Seedance 2.0不仅继承了强大的内容生成能力...
网易有道发布“OpenClaw”架构及个人助理Agent“LobsterAI”,试图打破AI仅能对话的局限。该技术聚焦于多工具编排、多模态输入与跨设备协同,旨在解决从“问答”到“任务执行”的闭环难题。此举若能稳定覆盖办公与生活场景,将显著提...
针对大模型在处理复杂表格识别任务中的实际表现,近期技术社区的反馈揭示了国产模型之间的显著差距。有开发者在对比测试中发现,虽然通义千问在该场景下被指表现不佳,但月之暗面的 Kimi(k2.5)在提取准确率上展现出较强竞争力。这一现象表明,在无...
这两周,几乎每天都在刷新的模型名字让人喘不过气: MiniMax(社区热议 M2.5)、GLM-5(媒体持续爆料)、Seedance 2.0、GPT-5.3-Codex、Claude Opus 4.6、Kimi K2.5,以及 Gemini...
蚂蚁集团于2月11日宣布开源发布全模态大模型Ming-flash-omni 2.0。该模型在视觉语言理解、语音可控生成及图像编辑等关键能力上表现强劲,在多项公开基准测试中部分指标超越了谷歌Gemini 2.5 Pro。作为业界首个全场景音频...
近日,科技社区热议谷歌AI模型Gemini疑似出现“降智”现象。有用户反馈,Gemini的多模态能力大幅下降,甚至出现将空客33x系列误认为波音787系列等低级错误,视觉识别表现被认为逊色于国内模型豆包。该现象引发了业界对于谷歌是否在为新模...
V2EX社区热议AI coding工具对传统文档格式的理解能力。用户发现Claude Code能够直接读取Excel接口文档、PDF流程图及Word需求文档,引发对其背后技术原理的关注。即便未手动配置多模态模型,Claude通常通过后台强大...
据Hugging Face Transformers代码库的最新提交,阿里通义千问Qwen 3.5系列模型发布在即。代码中最引人注目的技术更新是引入了`Qwen3_5DynamicCache`,证实新模型将支持“线性注意力”机制,这能有效处...