跳到主要内容
赞助推荐 搬瓦工怎么选:三网直连 CN2 GIA-E

实时动态 / 第 26 页

前沿哨所

追踪 AI、开源与工程领域的重要动态。

日期
10-08
本页
20 条
累计
27,275 条

开发者推出LLM评测基准浏览器:610个基准的构建与评分流程一站可视

一位开发者在V2EX分享了自己制作的LLM/Agent评测基准浏览器项目,旨在解决为Agent挑选benchmark时需要在论文、代码仓库和数据集页面之间反复切换的问题。该项目名为LLM Benchmark Costco,目前收录了610个LLM和Agent评测基准。用户可按能力类别、年份、开放程度等条件筛选候选基准,查看中英文介绍以...

核心观点Agent开发进入深水区后,评测基准的结构化整理正成为比榜单排名更稀缺的隐性基础设施。

阅读全文

开源NetOps技能包:让AI Agent修网络不再把自己修掉线

Linux.do社区发布开源项目NetOps,这是一组面向Codex、Claude Code等AI Agent工具的网络运维Skills,采用MIT许可证开源,提供中文说明和命令行诊断工具。项目源自开发者在维护VPS和代理配置时的常见痛点:Agent在修复网络故障时,由于自身依赖同一条网络连接,一旦执行重启代理软件、调整TUN或DNS...

核心观点Agent自主性的真正瓶颈不是会做什么,而是失败时能否留下退路,可恢复性设计正成为智能体落地的分水岭。

阅读全文

开源AI用量监控iOS小组件大更新:一个组件聚合9大AI平台用量

开发者StarYunLee在Linux.do社区分享了其开源AI用量监控iOS小组件的重构更新。该项目此前已支持Codex、Grok等订阅服务的用量与重置时间监控,此次升级将原本分散的三个平台组件聚合为单一的“AI Usage”组件,并在社区贡献者协助下扩展至9个常用AI平台。新版组件支持单账号模式(提供small、medium两种尺...

核心观点AI订阅全面铺开后,用量监控正从锦上添花变为刚需,聚合类小工具或催生iOS脚本生态新赛道。

阅读全文

ChatGPT频繁报错过载?实测Codex畅通无阻,疑官方客户端享有优先权

近期不少用户反馈ChatGPT频繁出现server_is_overloaded(服务器过载)错误,无论白天夜间均持续出现,反复重试也无法解决。一位用户在排查问题时意外发现,使用OpenAI自家的Codex工具可以正常访问,而切换至第三方客户端则持续报错。该用户随后进行了多轮对比测试:将第三方客户端升级至最新版本后问题依旧;尝试在客户端...

核心观点当算力成为稀缺资源,平台优先保障自家客户端只是开始,第三方生态的存续将永远受制于官方一纸调度策略。

阅读全文

AMD MI300X实测DeepSeek-V4-Flash:192G显存跑384K上下文很勉强

一位开发者在AMD DevCloud平台的MI300X GPU Droplet上,对DeepSeek-V4-Flash-0731模型进行了系统性推理性能实测。部署基于GitHub开源仓库完成,测试使用llmperf基准工具,覆盖基线、长上下文、压力测试及384K超长上下文等七种场景。基线场景(并发2)下,首token延迟均值0.37秒...

核心观点显存容量正成为大模型推理的第一性资源,AMD以192G大卡切入,能否撼动英伟达取决于ROCm生态的成熟速度。

阅读全文

开源终端Polter:让Claude Code当总管,指挥Codex等AI分工干活

开发者在Linux.do社区发布开源终端工具Polter,基于Ghostty终端fork开发,通过MCP协议将终端能力开放给AI。该工具瞄准多AI CLI并行开发的痛点:开发者同时开多个Claude Code、Codex终端窗口难以协调,子Agent长时间运行易因网络错误中断,跨session协作容易串号,通宵任务常在两小时左右停工。...

核心观点AI编程的竞争正从模型能力转向编排能力,谁能管住一群不偷懒的Agent,谁就握住下一代开发入口。

阅读全文

开源桌面客户端 DeepDeck:用 WebMCP 让 AI Agent 高效操控网页

开发者发布 DeepDeck,一个基于 DeepSeek Harness 的非官方社区桌面客户端,新增 WebMCP 浏览器与 Builder 两项功能,采用 MIT 协议开源,提供 Apple Silicon 和 Intel Mac 版本。项目的核心思路是提升 AI Agent 执行网页任务的效率:Harness 负责执行任务,We...

核心观点WebMCP 让网页从给人看转向给 Agent 用,结构化工具调用正逐步取代屏幕模拟,Agentic Web 雏形已现。

阅读全文

开发者推出 macOS 菜单栏收纳工具 StatusPerch:免费、免权限、隐私优先

一位开发者在 V2EX 分享了其开发的 macOS 菜单栏收纳工具 StatusPerch 1.0.0 版本。该工具针对 Mac 常驻软件增多、菜单栏图标拥挤的问题,尤其在刘海屏机型上空间紧张的场景,提供了简洁的收纳方案。用户按住 Command 拖动菜单栏项目,将兼容的低频图标放到边界左侧,点击箭头即可收起或恢复,还可设置展开后 5...

核心观点刘海屏加剧菜单栏拥挤,权限最小化的轻量本地工具正成为独立开发者切入 macOS 生态的务实路径。

阅读全文

Token 太贵?开发者开源 kcode,用免费网页 Chat 实现 Agent 效果

随着大模型 API 的 token 价格持续走高,AI 编程的使用成本成为开发者的现实负担。一位开发者在 V2EX 分享了其应对思路:利用厂商提供的免费网页版 Chat 服务,替代按量计费的 API,实现类似 AI Agent 的自动化任务执行。作者基于该思路创建了开源仓库 kcode,工作流程为:先由 AI 完成任务规划,再驱动 A...

核心观点用免费网页 Chat 复刻 Agent,本质是开发者对 token 高定价与订阅限额的民间反制,AI 工具定价体系正被用户行为倒逼调整。

阅读全文

AI训练AI时代临近?大模型迭代提速至三个月一次,自我进化循环初现

AI领域头部实验室的模型迭代节奏正在显著加快。以往大模型的更新周期普遍在半年以上,而目前已缩短至两三个月一次。从GPT 5.6 Sol到Astra的快速接续发布,以及此前DeepSeek V4 Flash和GLM 5.3的迭代节奏,均印证了这一趋势。需要指出的是,单一公司内部的模型训练并非串行进行:当GPT 5.6尚在训练时,GPT ...

核心观点当AI开始承担AI研发本身,迭代加速便从工程优化跃迁为自我强化循环,AGI时间表正被改写。

阅读全文

开源工具 Script Launcher:集中管理散落脚本,一键执行多语言命令

一位开发者在 V2EX 分享了其开源项目 Script Launcher,这是一款用于集中管理本地脚本的桌面软件,旨在解决脚本文件分散在桌面、项目目录等各处、辨识度低、查找运行不便的痛点。功能方面,Script Launcher 提供分组与入口管理,支持新增、编辑、删除、拖拽排序及跨分组移动;支持一键执行 Shell、Python、N...

核心观点脚本管理是开发者工作流的空白地带,轻量开源工具正以差异化定位填补效率工具的长尾需求。

阅读全文

独立开发者开源 Rust 嵌入式 KV 引擎 Mace:读场景性能达 RocksDB 2.9 倍

一位开发者分享了历时两年多打造的嵌入式 KV 存储引擎 Mace,项目已在 GitHub 开源。该引擎采用 Rust 编写,设计目标是同时获得 B+ Tree 读延迟可预测与 LSM Tree 写吞吐高的优点。核心特性包括:Bw-Tree 风格的有序索引搭配 MVCC 快照隔离、append-only WAL 日志与异步 checkp...

核心观点当 sled 沉寂、RocksDB 臃肿难嵌,独立开发者正用 Rust 在存储引擎的缝隙处证明单点性能突围的可能。

阅读全文

MiniMax H3 Max 登陆 fal.ai:社区推出视频生成成本计算器与提示词工具

MiniMax 旗下的 H3 Max 视频生成模型近日在 AI 推理平台 fal.ai 上线,凭借电影级视频生成能力吸引大量开发者与创作者关注。由于 fal.ai 采用按秒计费模式,且不同分辨率单价差异明显,480p 为每秒 0.05 美元,768p 为每秒 0.08 美元,在大规模生产场景下成本难以直观预估。为此,有开发者推出了第三...

核心观点当 AI 视频生成需要专门的成本计算器时,说明这门生意已从技术演示迈入精打细算的生产时代。

阅读全文

80行代码实现DOM响应式:极简开源项目Mador亮相Hacker News

一个名为Mador的开源项目以Show HN形式在Hacker News上发布,引发开发者社区讨论。该项目的核心亮点在于:仅用约80行代码,通过一个基于JavaScript Proxy的状态元组,即可让任意DOM元素具备响应式更新能力。其原理是利用ES6引入的Proxy对象特性——Proxy能够拦截并自定义对目标对象的基本操作。开发者...

核心观点当框架日益臃肿,80行代码的响应式实现证明浏览器原生能力已足以承载UI更新的核心需求。

阅读全文

OpenAI 内部视角:AI 如何加速科研本身

OpenAI 近日发文阐述其对“研究加速”的内部观察与思考,揭示了大模型技术如何反过来改变其自身的科研工作方式。文中指出,随着前沿模型能力持续提升,AI 已深度融入研究流程的各个环节:从代码编写、实验设计、数据分析到文献综述,模型正承担越来越多的重复性技术工作,使研究人员得以将精力集中于更高层次的科学问题。OpenAI 内部观察显示,...

核心观点当 AI 开始加速 AI 自身的研发,科研效率的复利曲线正成为头部实验室最深的护城河。

阅读全文

AI编程长会话响应等97秒,开发者开源Agent Handoff实现会话无缝交接

开发者在使用Codex优化前端UI时遭遇长会话性能问题:会话变长后频繁出现流断连和重试,连接从WebSocket降级到HTTP/SSE,响应明显变慢。排查发现单次请求体积已达约20.9MB,包含14张历史图片及大量消息与工具记录,每轮对话重复携带。在无重连的对话中,首次模型响应等待97秒,而工具实际执行仅0.831秒,第二次模型响应又...

核心观点AI编程的竞争焦点正从模型能力转向上下文治理,会话交接能力将成为Agent工作流的标配。

阅读全文

GPT6计费实测:官方或取消超272K长上下文双倍计费,中转工具规则滞后致成本虚高

GPT6更新发布后,一位论坛用户基于两个Team账号共5个5小时周期的实测,分享了对其计费机制的观察。实测显示,每个5小时周期的用量额度约为800万token;对于超过272K的长上下文请求,官方似乎已不再执行此前双倍计费的策略,这一变化对重度使用长上下文的用户构成利好。不过,用户同时发现两个可能导致实际使用成本上升的问题。其一,第三...

核心观点模型迭代快于工具适配,中转计费的规则时差正悄然放大AI使用成本的灰色地带,最终由用户买单。

阅读全文

GPT-6 Astra 额度异常?Pro用户实测周额度从2600缩水至1500

一位 OpenAI Pro 20x 订阅用户在 Linux.do 论坛发帖,称切换到 GPT-6 Astra 模型后订阅额度消耗异常加快,并通过自建统计工具给出了量化数据。该用户强调自己使用 Apple Store 美区礼品卡正价订阅官方套餐,全程未使用任何反代或第三方渠道,排除了渠道因素。为追踪额度消耗,作者此前编写了一个统计插件:...

核心观点订阅额度的黑箱算法正被民间逆向统计撬开,计费透明度将成为 AI 订阅服务下一阶段的隐性竞争点。

阅读全文

OpenAI Codex Windows 版曝严重故障:沙盒崩溃,编译部署全线瘫痪

2026年9月6日,OpenAI 旗下 AI 编程工具 Codex 的 Windows 端在更新至最新版本后出现严重故障。用户反馈,所有对话均报出「访问被拒绝」及「spawn EPERM」错误,工具无法正常发起权限授权请求,沙盒环境完全无法访问,且修改任何设置均告无效。受此影响,开发者无法借助 Codex 完成项目的编译、部署、验收与...

核心观点AI 编程工具的竞赛已从模型能力转向工程稳定性,一次沙盒故障足以动摇开发者刚建立的付费信任。

阅读全文