Uni-1 多模态绘图体验上线:强化空间理解与精准风格控制
一款基于 Uni-1 模型的在线 AI 图像生成平台近日在 V2EX 上引起关注。该模型主打多模态推理能力,尤其在空间理解方面表现出色,能够精准处理物体位置与场景布局。Uni-1 支持参考图可控生成与风格编辑,相比传统模型,它在理解 mem...
标签索引 / 第 6 页
这个标签下有 97 篇文章。按时间回看相关判断与实践记录。
标签精选
一款基于 Uni-1 模型的在线 AI 图像生成平台近日在 V2EX 上引起关注。该模型主打多模态推理能力,尤其在空间理解方面表现出色,能够精准处理物体位置与场景布局。Uni-1 支持参考图可控生成与风格编辑,相比传统模型,它在理解 mem...
开发者 Yuzc-001 在 GitHub 上开源了一款名为“hand-drawn-note-generator”的 AI 绘图工具。该项目针对 AI 绘图结果往往难以复现的痛点,创新性地设计了“双输出”模式:在生成手绘风格笔记图片的同时,...
开发者发布了 flow2api-mcp 开源项目,旨在通过 MCP(模型上下文协议)将 Flow2API 或兼容上游封装为高效绘图工具。该项目解决了直接调用画图模型体验生硬的问题,特别是优化了“图生图”工作流。通过建立本地缓存机制,实现了绘...
一位开发者在使用 Gemini Pro 尝试生成 Edge 浏览器手势操作图时遭遇了惨痛失败。尽管用户提供了清晰的参考图和详细的修正指令,要求 AI 绘制简单的圆心、方向箭头及文字标注,Gemini 却生成了大量逻辑混乱、元素缺失的图片。此...
Google 推出了名为 Flow 的 AI 电影制作工具,集成了 DeepMind 最强的视频生成模型 Veo。然而,有社区用户敏锐地发现,在该平台的渠道列表中,名为 ‘Nanobanana’ 的绘画功能似乎并不消...
Google Gemini 被发现在官网进行灰度测试,向部分用户推送了具备极强 SVG 代码生成能力的新模型。测试表明,该模型能根据复杂的自然语言指令(如“鹈鹕骑自行车”)直接生成精细的矢量图形代码。用户反馈,若 Gemini 在 Canv...
你最近要是多刷了几天抖音、快手或者 B 站,大概率见过这种内容:几张动漫质感很强的画面,角色颜值在线,剧情一句接一句往前推,配上旁白、配音和音乐,几分钟就能把一个悬疑、甜宠、修仙或者逆袭故事讲完。很多人第一反应是:这不就是 AI 一键生成的...
近日,一款名为 PixPark 的 AI 图像生成与编辑工具在科技圈引发关注。该平台最大的卖点在于打破了当前主流 AI 绘图工具的付费墙与门槛,提供完全免费、无需登录且无次数限制的生成服务。经过实际测试验证,用户在使用一个多小时的高频操作后...
据最新消息,知名AI绘图平台Midjourney的第八代版本(v8)预计将于本周正式发布Beta版。目前,关键的模型排名测试工作已宣告完成,除非出现重大技术阻碍,否则即将进入发布阶段。此次更新备受瞩目的亮点集中在文本生成效果的显著优化、对用...
本文记录了一位开发者在ComfyUI工作流中的趣味实验,旨在探索利用LLM自动生成AI绘画提示词的效果。作者通过编写专用Prompt,让不同的大模型为虚拟角色“绪山真寻”设计打歌服,并对比了基于已有角色进行微调与从零开始设计两种场景的生成结...