春节前夕国产大模型集体亮剑:字节豆包2.0、阿里千问3.5及DeepSeek新动作前瞻
据最新社区消息,国内AI领域在春节前后或将迎来一波密集的模型发布潮。字节跳动动作频频,不仅即将推出豆包2.0大语言模型,其视频生成模型Seedance 2.0和图像生成模型Seedream 5.0已在应用内测试,编码模型Giga-potat...
标签索引 / 第 12 页
这个标签下有 190 篇文章。按时间回看相关判断与实践记录。
标签精选
据最新社区消息,国内AI领域在春节前后或将迎来一波密集的模型发布潮。字节跳动动作频频,不仅即将推出豆包2.0大语言模型,其视频生成模型Seedance 2.0和图像生成模型Seedream 5.0已在应用内测试,编码模型Giga-potat...
可灵AI 3.0 正式发布,标志着AI视频生成从单一画面走向结构化叙事。该版本基于Diffusion与Transformer混合架构,创新性地引入“AI导演系统”,能自动拆解剧本并实现专业运镜。核心亮点包括原生视听同步技术(中文口型匹配准确...
部分Google Gemini用户反映,模型在对话中存在过度调用图片生成工具(如Veo3/Imagen)的问题。用户在进行设计探讨或提示词咨询时,即便明确要求文字回复,系统仍会频繁触发Nanobanana等后台服务强制生成图片。这一现象不仅...
上海人工智能实验室旗下的书生大模型团队发布了最新力作Intern-S1系列(含Intern-S1-Pro)。与侧重对话的通用大模型不同,该模型定位为“科学多模态基础模型”,旨在通过强化科学推理能力,解决科研领域的复杂问题。目前,Intern...
传统 AI Agent 只能处理文本。 但现实世界不只有文本,还有图片、音频、视频、传感器数据。 下一代 AI Agent 必须是多模态的。 能力一:视觉理解 让 Agent 能”看”。 应用场景: 图片分析:识别物...
近日,技术社区Linux.do针对国产头部大模型展开了新一轮的实测对比,聚焦于智谱GLM与DeepSeek OCR 2的OCR(光学字符识别)能力。此次对比基于特定的题库,通过五个不同维度的任务,全面评估了两者在文档还原、图文识别及多模态理...
据科技社区Linux.do爆料,有用户通过代码截图发现,Anthropic旗下的Claude似乎正在秘密开发图像生成模型。尽管目前官方尚未正式回应,但代码中出现的痕迹引发了外界关于该功能即将上线的强烈猜测。作为当前顶尖的大语言模型之一,Cl...
刷到一条 8 分钟左右的视频,核心信息其实很集中: Anti-Gravity(Google 的 agent-first IDE)把“写代码”从补全升级成 计划→执行→测试→交付 的闭环 Kimi 2.5(Moonshot AI 的多模态模型...
智谱AI发布开源多模态OCR模型GLM-OCR,基于GLM-V架构构建,专为复杂文档理解设计。该模型引入多Token预测损失函数及强化学习,集成了CogViT视觉编码器与0.9B参数的高效解码器。在OmniDocBench V1.5评测中,...
一款宣称采用“类脑架构”的多模态大模型即将接受测试,引发行业关注。该模型据称具备类似豆包的语音对话及视觉能力,且硬件门槛极低,仅需一张本地RTX 3090显卡即可运行。鉴于“类脑计算”通常依赖专用硬件,此次其在通用消费级显卡上的表现引发热议...