安卓 AI Agent 新选择:OpenOmniBot 开源,支持终端操作与 MCP 协议
社区发布了一款名为 OpenOmniBot 的开源安卓 AI Agent 项目。该项目的核心创新在于结合了 VLM(视觉语言模型)与 CLI(命令行界面)能力,不仅能操作安卓 GUI 应用,还通过 Termux 集成了 Ubuntu 终端环...
社区发布了一款名为 OpenOmniBot 的开源安卓 AI Agent 项目。该项目的核心创新在于结合了 VLM(视觉语言模型)与 CLI(命令行界面)能力,不仅能操作安卓 GUI 应用,还通过 Termux 集成了 Ubuntu 终端环...
微软正式宣布,其 Edge 浏览器将停止对 Manifest V2 扩展平台的支持,这一举措紧随谷歌 Chrome 的步伐,意味着包括广受欢迎的开源广告拦截工具 uBlock Origin 在内的数款扩展将无法继续正常运行。尽管微软声称目前受严重影响的扩展数量极少(仅提及个位数或极低比例的核心扩展),但这标志着浏览器生态向 Manifest V3 迁移的不可逆转趋势。Manifest V2 曾允许扩展程序拥有较高的权限以有效拦截广告和追踪脚本,而新的 Manifest V3 标准虽然在安全性和隐私保护模型上有所改进,但实际上通过限制网络请求修改的能力,大幅削弱了广告拦截器的效能。微软表示,已开始通知受影响的开发者,并设置了最终下线的具体时间表,敦促用户尽快迁移至支持新标准的扩展版本。然而,对于许多依赖强大隐私保护功能的资深用户而言,新版扩展往往无法达到旧版的拦截效果,这一技术变革引发了广泛的争议与不便。
💡 核心观点:浏览器巨头通过废弃 Manifest V2 统一战线,实质是在“安全性”名义下压缩隐私工具生存空间,或将引发用户隐私与商业利益的激烈博弈。
原文链接:Hacker News
曾凭借《神秘岛》(Myst)创下销量奇迹的美国老牌独立工作室 Cyan Worlds,近期遭遇了严重的资金困境。尽管其新作《Anglerfish》制作了完整的可玩演示且备受好评,但在接触了超过 12 家发行商后,仍未获得 100 万至 1000 万美元的融资。这导致该项目被迫无限期搁置,工作室不得不裁员一半。这一事件揭示了视频游戏行业“双 A”(Double-A)中端市场的崩塌:在利率飙升导致资本极其昂贵的当下,发行商不再愿意承担中高风险,只肯投资预算巨大的 3A 大作或极低成本的微型独立游戏。与此同时,Steam 等平台因 AI 工具的普及被大量低质量生成的“垃圾内容”淹没,据统计已有超过 1.8 万款游戏披露使用了 AI。这种内容泛滥不仅摧毁了玩家对平台推荐机制的信任,也极大地增加了优质中档游戏的营销获客成本,迫使开发者不得不缩减规模或完全依赖非传统融资渠道。
💡 核心观点:资本寒冬与AI生成内容的泛滥通过抬高获客成本和摧毁分发信任,正在联手绞杀中产阶级游戏开发者。
原文链接:Hacker News
近期在科技社区引发了一场关于国产AI智能体发展水平的讨论。话题源于一位开发者在企业入职培训中的亲身经历。在培训中,讲师重点演示了以豆包、WorkBuddy、Codz为代表的国产人工智能工具,展示了其在制作PPT、生成视频以及办公自动化等任务上的能力。虽然演示内容主要聚焦于通用办公场景,但现场生成的成果质量引起了在场技术人员的关注,显示出国产AI在应用层面的显著进步。然而,讨论的核心矛盾点在于垂直领域的对比。提问者长期习惯使用Codex(或类似的编程辅助工具)及Claude进行代码编写和逻辑推理,此前曾尝试用AI制作PPT但效果不佳。此次看到国产智能体在办公展示中的表现,引发了对于当前技术代沟的思考:国产大模型应用是否已经从单纯的模型参数竞赛转向了场景化落地,并与Claude等国际顶尖模型形成了差异化竞争。这不仅反映了国内AI应用在B端企业市场的渗透率提升,也揭示了用户对国产模型在复杂编程任务与高阶推理能力上仍存的疑虑。
💡 核心观点:国产智能体在中文办公场景下的体验优化显著,但在通用逻辑与编程能力上,距Claude等国际顶尖模型仍存在客观代差。
原文链接:Linux.do
蚂蚁集团旗下百灵大模型团队于 8 月 8 日宣布正式开源新一代原生混合推理模型 Ling-3.0-flash。该模型采用 1240 亿(124B)总参数、51 亿(5.1B)激活参数的 MoE(混合专家)架构,旨在通过稀疏化激活策略,在保证模型智能水平的同时,大幅降低推理计算成本。官方同步开源了基础版本以及 FP8、FP4、INT4 等多个量化版本,以适应不同的硬件环境。针对开发者与企业用户的差异化需求,官方提供了三种落地部署方案:面向快速迭代的云端 API 调用,平均输出速度达 353 tokens/s;面向数据隐私安全的单机私有化部署,在单台 NVIDIA DGX Spark 上即可完成端到端推理;以及面向高并发、低延迟场景的高性能部署,在指定 GPU 配置下平均输出速率突破 1100 tokens/s。根据 AA Intelligence Index 的数据,Ling-3.0-flash 在保持高智能水平的同时,加权平均调用成本约为 0.04 美元,解码时间约 1.4 分钟,成功进入“智能水平—任务成本”与“智能水平—任务耗时”的双重优势区域。目前该模型已在 Hugging Face 和 ModelScope 平台上线,且在 8 月 31 日前 API 调用享有 2.5 折优惠。
💡 核心观点:蚂蚁通过开源高性能 MoE 模型,试图在推理成本与响应速度的平衡点上建立行业新标杆,加速 AI Agent 应用落地。
原文链接:Linux.do
据科技媒体 IT 之家援引 Engadget 报道,AI 音乐生成平台 Suno 宣布将针对其平台生成的音乐内容,引入新型隐藏式水印技术和音频指纹识别系统。这一决策的背景是 Suno 目前正面临来自音乐版权方的多起法律诉讼,以及索尼音乐、环球音乐和华纳音乐等三大唱片公司组成的行业联盟的施压。
据悉,Suno 计划通过技术手段确保其生成的音频带有不可见的数字水印,该水印具备极强的隐蔽性,人耳难以察觉,但能够通过算法被精准识别。当这些由 AI 生成的歌曲被上传至 Spotify、Apple Music 等其他流媒体平台时,相关方可以通过指纹技术快速追溯其来源,确认其是否由 Suno 模型生成。此外,Suno 还同步设置了下载限制,旨在从源头上减少用户批量下载 AI 音乐并“洗稿”上传至主流音乐平台的现象。
此举标志着 AI 音乐生成领域进入了版权合规化的关键阶段。此前,三大唱片巨头曾明确致函流媒体平台,要求禁止缺乏“人类创作成分”的 AI 垃圾歌曲进入排行榜,并拒绝向 AI 公司授予训练版权。Suno 的技术升级被视为对此类行业要求的直接回应,试图通过技术手段解决内容滥用问题,从而在激烈的法律和舆论环境中为生成式 AI 技术争取合法的生存空间。
从产业格局来看,这标志着 AI 音乐行业正从单纯的技术竞赛转向“合规竞赛”。传统唱片巨头的联合封杀倒逼 AI 厂商主动构建监管技术,未来“可识别”、“可标记”可能成为 AIGC 产品的硬性准入标准。这不仅关乎 Suno 的法律生存,更可能成为后续视频、文本等多模态大模型在版权争议上的参考范式。
💡 核心观点:音频水印技术正成为 AIGC 商业落地的“合规通行证”,技术厂商需通过构建溯源机制来换取传统行业的准入许可。
原文链接:Linux.do
本文发布了一项针对 DeepSeek v4 Flash 0731(DSv4F)及多款国产平价大模型的编程能力基准测试报告。测试基于 Workbuddy-Bench-Code v1.0 数据集,包含 80 个编码任务,使用 CodeBuddy Cli 作为测试框架,并隔离了 Web 搜索等外部工具,以纯粹评估模型的代码生成与执行能力。在针对 DSv4F 的多渠道对比中,官方 API、OpenCode Go、Ollama Cloud Pro、Workbuddy 原生渠道、火山方舟及千问平台等六大渠道参与了测试。结果显示,各渠道提供的 DSv4F 模型在编程能力上几乎没有区别,评分表现一致,主要差异在于响应速度与计费策略。这意味着用户在购买 DSv4F 服务时,无需担心模型性能被“阉割”,可优先根据网络速度和预算选择供应商。在国产实惠档模型的对比中,DeepSeek v4 Flash 凭借性能优势成为该价位段的首选。MiniMax M3 在提供大额度的同时保持了可用性,而 Mimo 2.5 Pro 虽然价格便宜,但存在严重的任务中断问题,稳定性较差。LongCat 2.0 虽然性能平庸,但在低价套餐下的耐久度表现优异,且成本极低。测试还揭示了不同厂商的计费陷阱:Mimo 消耗了 34 元套餐的 80%,而 LongCat 仅消耗了 9.9 元套餐中的一部分。该报告为开发者在选购低成本 LLM 进行编程辅助时提供了详实的参考数据。
💡 核心观点:DeepSeek 凭借极致性价比与多渠道一致性重塑市场格局,国产平价竞品在稳定性与长上下文处理上仍存短板。
原文链接:Linux.do