实战教程:结合SAM与X-AnyLabeling实现数据集半自动标注的高效工作流
本文分享了一套高效的AI图像分割数据集半自动标注工作流。作者通过结合Meta的SAM模型进行初始标注,训练轻量级YOLOv8n-seg模型并导出ONNX,随后集成到X-AnyLabeling工具中实现半自动化批量标注。对于预测效果不佳的数据,再利用SAM进行二次校验与修正。文章详细介绍了配置步骤、模型库选择及JSON格式转换方案,并附...
阅读全文实时动态 / 第 940 页
追踪 AI、开源与工程领域的重要动态。
本文分享了一套高效的AI图像分割数据集半自动标注工作流。作者通过结合Meta的SAM模型进行初始标注,训练轻量级YOLOv8n-seg模型并导出ONNX,随后集成到X-AnyLabeling工具中实现半自动化批量标注。对于预测效果不佳的数据,再利用SAM进行二次校验与修正。文章详细介绍了配置步骤、模型库选择及JSON格式转换方案,并附...
阅读全文通义千问团队发布了全新 Qwen3-Coder-Next 模型。该模型虽然拥有 80B 的总参数量,但采用了高效的架构设计,推理时仅需激活 3B 参数。这意味着它在保留千亿级模型知识容量的同时,极大降低了推理开销,非常适合在本地运行 Coding Agent。目前该模型已完美适配 Cline、OpenClaw 和 Claude Cod...
阅读全文近日,技术社区Linux.do针对国产头部大模型展开了新一轮的实测对比,聚焦于智谱GLM与DeepSeek OCR 2的OCR(光学字符识别)能力。此次对比基于特定的题库,通过五个不同维度的任务,全面评估了两者在文档还原、图文识别及多模态理解方面的表现。这一评测不仅揭示了DeepSeek在多模态领域的最新进展,也为开发者模型选型提供了...
阅读全文针对当前 AI 辅助开发中常见的“过度重构”、“上下文丢失”及“团队协作难对齐”等痛点,Open GDD 应运而生。这是一个专为 AI Agent 设计的 Markdown 游戏设计文档模板,涵盖 13 个标准章节。其核心在于引入了代码化协作思维:通过章节引用和 Git 工作流,开发者可精确指定 AI 的修改范围,实现像 Code R...
阅读全文面壁智能发布了 MiniCPM-o 4.5,这是一款总参数量仅 9B 的端侧多模态大模型。其性能直逼 Gemini 2.5 Flash,核心亮点在于支持全双工多模态实时流式交互,打破了输入与输出的阻塞,实现了“边看、边听、边说”的流畅体验,并具备主动提醒和声音克隆能力。配合高性能的 llama.cpp-omni 推理框架,该模型成功将...
阅读全文智谱AI旗下的轻量级OCR模型GLM-OCR正式发布。该模型参数量仅为0.9B,延续了当前AI模型向端侧和轻量化发展的趋势。官方数据显示,尽管体积小,但其在公式识别、表格还原和信息提取方面均达到SOTA(当前最佳)水平。在性能测试中,GLM-OCR处理PDF的速度可达1.86页/秒,显著优于同类竞品。这一突破意味着在算力有限的普通服务...
阅读全文这份来自技术社区的名单极具含金量,系统梳理了在X(原推特)上最值得关注的20余位AI领域关键人物。名单不仅涵盖了Andrej Karpathy、Sam Altman等OpenAI核心高管及AI教育泰斗,还包括深耕具身智能、提示词工程、大模型应用开发的实战派专家。对于想要精准把握AI技术趋势、学习提示词工程或了解前沿工具的开发者与科技爱...
阅读全文针对Claude AI在使用中频繁出现的上下文上限及清空后信息丢失的痛点,开发者推出了开源项目ccb(claude_code_bridge)的新功能。该功能能够实现上下文的自动整理与迁移,在用户清空对话后,自动将上一轮上下文保存为Markdown文件,并智能过滤协议标记等噪音,保留工具调用摘要。用户只需在新对话中@该文档,即可恢复上下...
阅读全文一位开发者在尝试将 Claude Code 的底层模型替换为智谱 GLM-4 时,发现了一个引人深思的技术现象:尽管修改了配置文件中的 base_url,Claude Code 依然在后台自动调用 z.ai(智谱AI)提供的 MCP(模型上下文协议)工具,如 web_search 和 web_fetch。这一现象引发了关于 AI 代理...
阅读全文近日,有科技博主在论坛分享了鸿蒙系统6.0.130版本的最新AI应用体验。在图库应用中,用户仅需长按AI导航条并发出语音指令“帮我把这张图改成水墨画”,系统即可调用大模型瞬间将普通照片转化为极具质感的中国水墨画。实测表明,该功能不仅生成速度快,且图片风格处理细腻。这一功能展示了盘古大模型与鸿蒙底层的深度融合,标志着移动操作系统正从被动...
阅读全文OpenAI 正式宣布针对 GPT-5.2 及 GPT-5.2-Codex 模型进行性能升级。通过深度优化底层推理栈,新版本在保持模型权重和架构完全不变的前提下,实现了 40% 的速度提升并显著降低了延迟。这一改进即刻对所有 API 开发者生效,旨在大幅提升开发效率与终端用户体验。这标志着大模型竞争已从单纯追求参数规模,转向工程化落地...
阅读全文Google的AI助手Gemini近日推出了一项针对学术场景的重要更新:现在当用户请求添加科学文献时,Gemini能够生成符合APA格式规范的正确内联引用及详细的参考文献列表。这项功能旨在解决学术写作中引用规范的痛点,将极大地帮助学生和研究人员提升写作效率与内容可信度。目前该功能正处于灰度测试阶段,仅针对具有明显科学性质的提示词触发,...
阅读全文知名开源AI助手OpenClaw(前Moltbot)被曝存在严重安全漏洞(CVE-2026-25253)。该漏洞允许攻击者利用设置逻辑缺陷和WebSocket连接,通过“一键”点击实现远程代码执行(RCE)。考虑到该工具拥有超过10万开发者用户且通常被授予较高系统权限,攻击者可轻易窃取敏感数据及API密钥。目前技术细节已公开,建议用户...
阅读全文著名安全专家Bruce Schneier深入剖析了AI时代的信任危机。文章指出,人类常混淆基于情感的人际信任与基于制度的社会信任。大型科技公司将利用AI拟人化的特性,诱导用户将其视为朋友而非服务,从而成为企业利益的“双面间谍”。Schneier强调,市场无法自我修正,政府必须通过立法,强制AI开发者承担受托人责任,并建立公共AI模型,...
阅读全文这篇文章详细记录了一位无硬件背景的作者首次制造并发货500台高功率LED灯具的艰辛历程。内容揭示了从设计、供应链管理到质量控制(如因线缆标识错误导致的功能故障)的种种现实挑战。评论区的讨论进一步分析了专业级硬件与廉价产品的成本差异,并强调了“硬件难做”并非虚言,其工程复杂度远超软件,对于计划涉足实体产品的创业者极具参考价值。
阅读全文一项最新研究警告,由LLM驱动的“氛围编程”正严重威胁开源软件(OSS)生态的存续。这种现象使开发者无需理解代码逻辑,仅依赖聊天机器人生成软件,导致用户不再访问项目官网、阅读文档或参与社区互动。数据显示,自GitHub Copilot发布以来,相关工具不仅未提升效率,反而在2024年增加了41%的Bug,2025年更导致生产力下降19...
阅读全文一位社区成员分享了可用的 DeepSeek API 测试接口,该接口基于 Hugging Face Space 部署。分享者提供了完整的 curl 调用命令,用户只需填入 Bearer Token 即可体验 `deepseek-chat` 模型。在官方 API 注册受限或额度紧张的背景下,此类自发共享资源为开发者和极客提供了宝贵的模型...
阅读全文法国司法警察近日突击搜查了社交媒体平台X(前推特)位于巴黎的办事处,作为正在进行的在线仇恨言论调查的一部分。此次搜查重点聚焦于平台在处理儿童性虐待图像及AI深度伪造内容方面的合规性。法国当局正在调查X是否涉嫌在该类非法内容的传播中存在共谋,特别是算法推广机制是否助长了这些有害信息的扩散。此事再次引发了对AI生成内容监管及科技巨头法律责...
阅读全文一位程序员在求职季因不愿面对传统照相馆繁琐的流程(洗头、化妆、排队、等待),利用自身的编程技能与AI模型,开发了一款在线证件照生成工具。该网站支持将随手拍的生活照转化为专业级职业形象照,并根据用户反馈迭代出多种风格(如韩式、美式校园风)。这一案例展示了生成式AI如何将高门槛的线下服务转化为标准化的数字产品,以极低成本解决了大众的实际痛...
阅读全文文章深入探讨了中国载人登月计划对全球航天格局的影响。随着“梦舟”载人飞船和“揽月”着陆器在河北成功进行发动机测试,中国正朝着2030年载人登月的目标稳步迈进。这一进展不仅展示了中国航天技术的硬实力,也给NASA的“阿耳忒弥斯”计划带来了巨大的时间压力。文章分析了中美两国在航天领域既竞争又非完全对抗的微妙关系,指出中国航天的快速崛起正在...
阅读全文