Claude Code 雷达的公开页面目前写明:服务暂时关闭,页面上的额度和固定评测区都在等待新数据。旧图表可以帮助理解它曾经测什么,但不能再当成今天的实时状态。
这不是说 Claude Code 没有可观察的数据,而是要把三种东西分开:订阅额度、固定 benchmark 和个人体感。把它们混成一个“模型变笨了”的判断,最容易误导自己。
旧雷达还能看什么
旧页面留下了三个有价值的概念:
- 额度窗口:5 小时和 7 天窗口会影响能不能继续跑长任务。
- 固定评测:用同一组任务重复运行,才有资格比较变化。
- 社区体感:真实使用者对准确性、返工次数、速度和稳定性的感受。
它们的作用不同。额度回答“还能不能跑”。固定评测回答“同一题是否稳定”。体感回答“今天用起来顺不顺”。任何一项单独异常,都不等于模型能力已经变化。
暂停状态下怎么判断
先看自己的会话。短任务正常、长任务频繁压缩,通常是上下文和任务结构问题。固定任务失败、同一版本反复复现,才值得记录为模型或工具问题。额度耗尽则是订阅窗口问题,不是质量问题。
可以把观察分成三层:
- 本机:命令是否成功、测试是否通过、上下文是否膨胀。
- 订阅:当前窗口、剩余额度、重置时间。
- 公共:官网状态、公开 benchmark 和多名用户的相同复现。
个人遇到一次失败,只能放在第一层。不要立即把它写成公共结论。
分布式评测和 Claude 状态是两件事
面向 Codex 的分布式评测有自己的客户端、任务和数据口径。参与者在本机准备环境、领取任务和提交结果。运行任务会使用 Docker、磁盘和模型额度。
如果你要看公开任务、隐私和成本边界,请读 分布式评测主入口。不要把另一套 benchmark 的结果套到 Claude Code,也不要用 Claude Code 的暂停页面解释它的状态。
比看雷达更有用的日常动作
- 长任务开始前,先写清完成条件和验证命令。
- 一次只改变一个变量:模型、推理档位、上下文长度或任务本身。
- 失败后保留命令输出和最小复现,不要只记“今天很差”。
- 订阅窗口紧张时,先做检查和拆分,不要开多个重任务赌额度。
这些动作比刷新图表更能减少返工。可以结合 Claude Code 用量怎么算、Claude Desktop 使用指南、AI Agent 上下文爆炸 和 AI 编程 Agent 的免审批风险 建立自己的记录方法。
一手资料
Claude Code 雷达恢复前,最稳妥的做法是把它当成历史参考。当前决策仍以自己的验证、官方状态和可复现的问题为准。






评论前必须登录!
立即登录 注册