开源新工具:基于 Gemini 的短视频与漫画 AI 制作神器
社区开源了一款基于 Google Gemini 的短视频及漫画制作工具。该工具集成了 nano banana 和 VEO 模型,用户需自行配置 API_KEY 并支持第三方供应商接口。目前支持本地部署,虽仅在 macOS 上经过测试,但其他...
标签索引 / 第 100 页
这个标签下有 1711 篇文章。按时间回看相关判断与实践记录。
标签精选
社区开源了一款基于 Google Gemini 的短视频及漫画制作工具。该工具集成了 nano banana 和 VEO 模型,用户需自行配置 API_KEY 并支持第三方供应商接口。目前支持本地部署,虽仅在 macOS 上经过测试,但其他...
Kyber是YC W23孵化的AI原生文档平台,专注监管通知流程。公司18个月内收入增长30倍并实现盈利,已签约多家头部保险企业。现招聘技术主管,要求不仅负责全栈架构,更需规模化应用Cursor、Claude Code等AI Agent工具...
Google Chrome 正在大力集成 AI 功能,但默认往往处于隐藏状态。GitHub 用户分享了一个实用脚本,允许非开发者用户一键开启 Chrome 的 AI 实验性功能。这意味着用户无需修改复杂的内部参数,即可提前体验包括本地 AI...
通义团队发布了新一代 LLM-Agent 强化学习平台 AgentJet (Beta)。该框架支持对 AgentScope、LangChain 等技术栈构建的智能体工作流进行微调。AgentJet 专注于 Triple-M 概念,即多轮对话...
近期,Agent Skills概念迅速升温,相关生态在短短三天内呈现爆发式增长。与此同时,支持MCP协议的uTools插件“AI Anywhere”等工具的推出,大幅降低了普通用户调用AI代理的门槛。结合Python凭借AI热度稳坐TIOB...
传统 AI 模型在处理图像时常因静态观察而遗漏细节。Gemini 3 Flash 推出的 Agentic Vision 改变了这一现状,它将视觉理解转变为一个包含“思考、行动、观察”的代理式循环。通过启用代码执行功能,模型能主动操作影像(如...
AgentVerse 是一个开源的多智能体群聊与自治对话实验平台。该项目旨在让拥有不同思维方式、立场和角色的智能体在同一会话中进行对话、协作与碰撞,从而产生真实的讨论张力与结论沉淀。核心功能包括多智能体自动接话、讨论流程控制、观点冲突与互补...
沃顿教授Ethan Mollick通过一项实验发现,MBA学生利用Claude Code和Google Antigravity等AI工具,仅用四天便完成了通常需要数月的初创公司原型开发。文章指出,在智能体AI时代,传统的“提示词工程”正在被...
亚马逊宣布关闭旗下Amazon Fresh杂货店和Amazon Go“拿了就走”便利店,这标志着其进军实体零售核心业务的重大撤退。亚马逊承认,尚未找到既能创造独特客户体验、又具备大规模扩张经济模型的正确方案。部分门店将改造为全食超市。此次关...
Kimi最新发布的K2.5模型展现了显著进步,其多模态能力在真实用例中已基本持平甚至超越Gemini 3系列。在特定图像识别盲测中,K2.5对风格与角色的识别准确率优于Gemini 3 Pro,显示出知识库与图像理解能力的双重提升,标志着国...