谷歌NotebookLM推“电影级”视频模式,整合Gemini与Veo模型重塑AI叙事
Google近日为NotebookLM上线了Cinematic(电影级)视频模式,标志着AI阅读助手从文本摘要向动态视频生成进化。该模式结合Gemini 3音频与Veo 3视频模型,能将文档转化为约5分钟、包含动态画面的视频综述,主要由AI...
标签索引 / 第 9 页
这个标签下有 190 篇文章。按时间回看相关判断与实践记录。
标签精选
Google近日为NotebookLM上线了Cinematic(电影级)视频模式,标志着AI阅读助手从文本摘要向动态视频生成进化。该模式结合Gemini 3音频与Veo 3视频模型,能将文档转化为约5分钟、包含动态画面的视频综述,主要由AI...
一位个人开发者发布了名为 Agent S6 的浏览器扩展,旨在为 Claude for Chrome 和 Gemini Auto Browse 提供替代方案。该工具最大的亮点在于注重隐私保护,支持自带 API Key (BYOK) 模式,实...
Yuan3.0 Ultra多模态大模型正式发布并开源。该模型采用统一架构,结合视觉编码器与103层Transformer语言主干网络,基于混合专家(MoE)技术构建。通过创新的LAEP方法,模型参数规模优化至1010B,激活参数为68.8B...
Qwen(通义千问)正式推出3.5系列小型模型,涵盖0.8B、2B、4B和9B四个版本。该系列模型基于统一的Qwen 3.5平台构建,核心优势在于具备原生多模态能力、改进的架构以及扩展的强化学习机制。新模型针对不同场景进行了精准定位:0.8...
阿里巴巴千问团队宣布开源Qwen3.5系列的四款小尺寸模型(0.8B、2B、4B、9B),进一步完善开源生态。其中,0.8B和2B模型极致轻量,0.8B更是支持多模态,成为移动端与IoT设备的理想选择;4B模型被定位为轻量级Agent强劲基...
针对传统社区审核工具仅支持关键词匹配的局限性,开发者推出了一款基于 LLM 的 Flarum 内容审核插件。该插件利用大语言模型的多模态能力,不仅能精准识别文本违禁词,还能智能审核用户上传的图片、头像及签名,显著降低 UGC 社区的法律风险...
据《金融时报》报道,DeepSeek计划于下周发布代号为V4的新一代大语言模型。不同于以往的纯文本模型,V4将是一个支持图片、视频和文本生成的“多模态”模型,标志着其在多模态领域的重大突破。尤为引人注目的是,DeepSeek已与华为及寒武纪...
Linux.do社区用户针对DeepSeek最新模型检查点进行了深入测试。对比发现,非推理版本(v4l)底座实力强劲,在CSS编写等需要审美直觉的任务上表现出色,甚至媲美Claude;而融合了v3.2 speciale的推理模型虽然逻辑更严...
一项针对大语言模型(LLM)在垂直领域应用深度的调研正在展开。调研指出,当前LLM虽能顺畅处理单一PDF,但在面对泛金融(如投研尽调)和泛法务(如合规审查)中涉及的多文件、跨模态(Excel、PDF、截图、图片等)及长上下文的复杂任务时仍显...
该资源汇集了知乎AI大模型全栈工程师培养计划(第六期)的完整课程体系,为当前AI开发者提供了一套系统化的学习图谱。课程内容极具深度,不仅涵盖软件开发基础、Prompt工程、神经网络与Transformer底层原理,还深入解析了RAG、Emb...