很多人打开 Codex 雷达,先看一个模型今天是涨还是跌。真正影响结果的部分不在图表,而在图表背后的任务是怎样跑出来的。
DRadar 是分布式雷达的本地客户端。它在参与者自己的电脑上检查环境、领取 benchmark 任务、调用本机已经登录的模型工具、保存中断点,再把结果交给服务端独立判分。它不是“跑一下就得到模型 IQ”的网页插件,也不是一个会替你管理订阅额度的工具。
用它之前先分清两件事。查看格子是只读操作。领取和运行任务会使用 Docker、磁盘、网络,以及你的模型额度。把这条边界搞清楚,比跑出一个分数重要得多。
Codex雷达在测什么
Codex 雷达的公开页面展示的是经过同一任务口径整理后的结果。DRadar 客户端负责把一次本地运行变成可验证的提交。客户端本身不决定模型高低,也不拿“主观体验”替代 benchmark。
一次完整流程包含四层:
- 本机准备 Docker、任务环境和已登录的模型工具。
- 用户选择或领取公开任务。
- Pier 在隔离任务环境中运行 Agent,保留 checkpoint 和产物。
- 服务端重新校验提交,给出成绩或拒绝原因。
把它想成开源项目的 CI。你的电脑负责跑测试,服务端负责复核结果。网页上的分数是最后一层,不是第一层。
因此,Codex 雷达最适合回答“同一任务口径下,哪个模型档位更稳定、速度和成本怎样”。它不适合替你判断某个具体仓库能不能交付,也不能证明你的个人订阅一定和公开样本一样。
如果你只是想选日常 AI 编程工具,先读 Codex vs Cursor 额度对比、Codex CLI Intel Mac 安装指南 和 AI 编程 Agent 横评。雷达数据可以帮助做选择,但不应该取代真实项目的试跑。
第一步只看格子,不领取任务
首次接触时,不要直接执行 go。先用只读命令看公开任务和本机容量。
uvx --from git+https://github.com/SecurityMind/dradar dradar cells --available --limit 10
uvx --from git+https://github.com/SecurityMind/dradar dradar capacity
cells 只读取与网页相同的公开快照,不认领任务。它适合查看任务名称、支持的模型、推理档位、预估时长和成本信息。
capacity 也不会领取任务。它检查 Docker 真正可用的 CPU、内存、磁盘和账号限制,再给出保守并发建议。不要按电脑宣传配置猜资源。Docker Desktop、OrbStack 和 Colima 往往只分到主机资源的一部分。
如果列表里没有适合你的模型或额度,停在这一步即可。没有必要为了“贡献一次”强行跑一题。
环境检查会做什么
真正运行前需要登录并做环境检查。命令形态如下,Token 应从官网获取,不要复制到 shell 历史或截图里。
dradar login --server https://api.codexradar.com --token <YOUR_TOKEN>
dradar doctor
doctor 不只是打印版本号。它会检查 Docker、Compose、Pier、模型登录态、任务仓库、可用磁盘和服务端连接。缺失的依赖在部分平台上可能被建议安装或自动准备,所以它不是纯展示命令。
macOS 可以使用 OrbStack 或 Docker Desktop。Windows 需要 Docker Desktop 运行 Linux containers。WSL2 应在普通 Linux 发行版里运行,不要把 Docker Desktop 自带的内部发行版当成日常终端。
环境不通过时,先修环境,不要用 -y 跳过确认。后者只会让失败发生在 Docker 构建或模型调用之后,排查成本更高。
可以把 Codex 工作流与自动化、AI Agent 上下文爆炸 和 Codex 原生通知 作为配套阅读。它们讲的是日常工作流;DRadar 讲的是受控 benchmark 运行,两条链路不要混在一起。
领取任务前先设额度边界
go 和 resume 会执行任务。运行之前,至少要明确任务数、并发数和额度上限。
dradar go --pick TASK_ID:MODEL:EFFORT
dradar go --auto 3
--pick 只尝试你指定的格子。格子已经被领取时,客户端会跳过,不会悄悄换成另一道题。
--auto 3 的意思是把当前持有批次补到总数 3,不是再额外加 3 题。它仍会受服务端持有上限约束。
需要并发时,先让 capacity 给出建议。默认是单 worker。多 worker 会同时占用 Docker、磁盘和模型额度,不能把“机器有 32 核”直接理解成适合开 32 个 Agent。
持续补题是另一层风险。只有在你愿意承担持续额度消耗时,才使用 --refill,并同时给出任务数或额度百分比硬上限。例如:
dradar resume -y --benchmark deep-swe --workers 2
--refill --refill-to 2 --max-tasks 10
--quota-tier pro-5x --max-estimated-quota-pct 10
这里最关键的是两个上限。--max-tasks 控制总任务数。--max-estimated-quota-pct 控制估算的 7 天额度占比。估算不是订阅平台的实时余额,不能把它当成账单。
订阅额度本身仍要结合 Codex 订阅额度逻辑、Codex Agent 工作流 和 AI 编程订阅的选择 一起判断。公开 benchmark 的成本模型,只能帮助你设置保守门槛。
中断后不要从头再跑
DRadar 会把工作区差异、阶段、必要的 usage 状态和 checkpoint 放到本地目录。网络抖动、CLI 中断或机器重启后,优先使用:
dradar checkpoints
dradar resume
dradar resume --assignment <ASSIGNMENT_ID>
恢复不是无条件成功。客户端会检查 assignment、任务版本、Harness 和 provider 是否兼容。状态损坏或身份不匹配时,它会保留现场并停止不安全的恢复,不会假装新会话等同于旧会话。
上传失败也不需要重跑模型。只补传已有产物:
dradar retry-upload
这条命令不会领新题或执行新任务。它只处理已经完成、但因为网络或服务端暂时不可用而没提交的结果。
如果你需要审核 Agent 产生的改动,可以先看 AI 编程 Agent 免审批的风险、设计合约插件 Click 和 Cursor 接入持久化 Codex 风格 Agent。评测跑通不代表补丁就能直接进入生产。
本地数据、隐私与清理
DRadar 默认使用 ~/.dradar 保存配置、任务、checkpoint 和待补传记录。配置里可能有服务端地址和身份 Token,应按私有文件处理。
公开文档说明,checkpoint 不保存账号 Token、API Key 或 OAuth 文件。遇到通用凭据形态时,客户端会省略相关内容,并把恢复降级为“工作区 + 新会话”。这个设计只能减少泄漏面,不能替代你的本机安全策略。
运行期间的心跳用于展示进度和诊断。它不上传任务正文、prompt、patch、命令输出、用户名或订阅凭据。你仍应把任务目录和模型配置当成敏感工作区处理。
清理也要先预览:
dradar cleanup --dry-run
dradar cleanup
默认清理会保护正在运行、可恢复、待补传或用 --keep 保留的任务。不要为了腾空间直接执行全局 Docker prune。DRadar 明确不自动碰其他项目的镜像和 BuildKit 缓存。
这类边界和 AI Agent 高权限风险、Agent 安全事故 是同一个问题:工具能做什么,取决于运行环境给了它什么权限。
怎么读雷达结果
看结果时先问三个问题:
- 任务是否相同?不同任务的分数不能直接横比。
- 模型、推理档位和运行时间是否相同?同一模型的不同档位经常是不同产品。
- 成本是按量费用、订阅等值,还是未知?没有可靠成本数据时,不能填 0。
网页上的体感分可以反映近 24 小时用户感受,但它和 benchmark 的用途不同。体感分适合发现异常,固定任务适合做重复比较。两者相反时,先检查任务覆盖面和样本,再下结论。
个人建议是把 Codex 雷达当作“是否值得试跑”的筛选器。真正决定你用哪个模型的,还是自己的仓库、测试和 review。你可以从 Codex CLI 入门、Codex 磁盘占用排查 和 Codex Mac Intel 支持 开始,把公开结果放回真实工程里验证。
一次安全的最小验证
如果你只是想确认自己的机器能否参与,最小流程只需要三步:先看公开格子,再检查容量,最后运行 doctor。前两步不认领任务,doctor 负责告诉你 Docker、登录态和磁盘是否达标。
dradar cells --available --limit 10
dradar capacity
dradar doctor
只有这三步都正常,才考虑领取一题。第一次不要使用自动补题,也不要打开多 worker。选一题、保留 --keep 现场、记录实际耗时和额度变化。成功提交后再决定这个工作流是否值得常驻。
这套顺序的价值不在于跑得快,而在于把“看数据”“确认环境”“真实消耗额度”三个阶段拆开。出现异常时,你能知道问题发生在什么环节,不会把 Docker 故障误判成模型能力下降。
FAQ
cells 会消耗我的额度吗?
不会。它只读取公开格子表,不领取任务,也不会启动容器或模型。
doctor 是不是完全只读?
不是。它主要做检查,但在缺少依赖的环境可能提示或尝试准备运行条件。首次运行前应看终端输出,不要无人值守执行。
没有 Docker 能不能贡献?
当前任务 runner 使用 Pier 和 Docker。先运行 dradar doctor 看缺少什么。不要在 Docker 不可用时直接领题。
运行失败后为什么不建议立即再领一题?
失败可能来自同一个环境问题。先用 resume 或 retry-upload 处理已有任务。重复领题会扩大额度和磁盘消耗。
公开结果可以用来证明我的模型“更聪明”吗?
不能。它只说明在公开任务、指定版本和指定运行条件下的表现。选型仍要回到你自己的代码、延迟、成本和可维护性。
相关阅读
一手资料
如果你只想看公开结果,停在 cells 和网页即可。只有在 Docker、额度上限和清理边界都已确认时,才值得把本机接进评测网络。