开源项目:让Gemini AI接管你的手机 - Open-AutoGemini解析
Open-AutoGemini是一个开源项目,基于Open-AutoGLM框架开发,专门适配谷歌Gemini AI模型,使其能够接管并控制手机操作。该项目利用Gemini 3 Flash强大的多模态能力和高速响应特性,通过原生工具调用实现高...
标签索引 / 第 17 页
这个标签下有 190 篇文章。按时间回看相关判断与实践记录。
标签精选
Open-AutoGemini是一个开源项目,基于Open-AutoGLM框架开发,专门适配谷歌Gemini AI模型,使其能够接管并控制手机操作。该项目利用Gemini 3 Flash强大的多模态能力和高速响应特性,通过原生工具调用实现高...
这款AI驱动的一站式绘图平台正式上线,用户可免费体验。平台支持三个绘图引擎,响应速度达秒级,并优化了Mermaid等图表样式。提供项目管理系统,所有数据本地存储,保障隐私。支持多模态输入,包括文档可视化、图片复刻和链接解析。版本管理功能完善...
近日,全国规划资源领域首个基础大模型‘云宇星空大模型(专业版)’在上海正式发布。该模型由上海市规划资源局与商汤大装置联合研发,基于海量高质量‘文本-图像-空间’多模态行业语料,实现了城市空间治理领域全链路认知与决策能力的突破性构建。技术底座...
本文系统拆解大模型选型的核心技术参数,涵盖模型系列、架构类型、参数规模、后训练方式、量化精度和上下文长度。作者基于两年AI应用开发经验,详细解析了如Qwen3、VL、MoE等专业概念,并提供了量化精度选择策略和显存估算方法。文章强调理解这些...
本文详细介绍了一款名为MTGA的开源工具,帮助个人开发者突破Trae企业版限制,实现自定义API与大模型接入。通过四个简单步骤,用户可轻松配置代理服务,支持GPT-4o、Claude 3.5等先进模型,甚至启用多模态能力。教程提供了详细的参...
作者为完善RAG(检索增强生成)教程,计划新增多模态年报检索或文档规范审查项目实战,现公开征集技术建议和改进意见。教程基于GitHub开源项目(https://github.com/datawhalechina/all-in-rag),社区...
Gemini Nexus v3.1作为Chrome浏览器插件,成功免密钥调用Google Gemini人工智能,带来多项创新功能。更新包括生图自动去水印、图片编辑、思考过程显示、多模态文件上传、截图翻译、整页聊天以及支持发送图片等。用户只需...
Gemini Nexus v3.1是一款强大的Chrome浏览器扩展,集成Google Gemini AI,提供多种实用功能。新版本支持生图自动去水印、图片编辑、思考过程显示、多模态文件上传、截图翻译、大香蕉绘图、整页聊天,并支持发送图片。...
本文分享了作者使用多种AI模型的实战经验,包括GPT-5.2-thinking用于方案生成、Claude-4.5-opus用于代码重构、DeepSeek-R1-0528用于中文分析。作者回顾了从GPT-4o到Gemini-2.5的迁移过程,...
大模型周刊(第11期):GPT图像生成大升级,Gemini 2.0 Flash成新默认 TL;DR 本周AI领域密集发布:OpenAI的GPT Image 1.5让图像生成速度提升4倍;Google的Gemini 2.0 Flash以极低成...