OpenAI: GPT-6 Astra
openai · 闭源
1,050,000 tokens 上下文
参考输入 $10 / 百万 tokens
AI模型参考用真实仓库的小任务评估正确性、修改范围和总成本。
选择一个能在本地复现的问题,记录环境、依赖版本、复现步骤和预期行为。修复任务的合格标准应包括原有测试继续通过、新问题被覆盖,以及没有不相关修改。
候选依据本站编程参考榜。不同公开评测的任务范围并不相同,网页生成表现不能直接代表大型仓库维护能力。请使用与你的语言、框架和代码规模接近的任务再验证。
向每个模型提供相同的代码、限制条件与测试命令。保存第一次输出及后续修复轮次,分别记录测试通过情况、人工修改量和累计输入输出。运行生成代码时使用隔离环境,不把通过文字自述当成通过测试。
先估算每次调用输入与输出,再乘以实际调用次数。还要记录失败重试和工具返回占用的上下文。可在成本工具中分别建立少轮次与多轮次两种预算场景。
候选采用本站公开参考数据;本文没有把榜单名次当作本站任务实测结果。
依据编程参考榜筛选,列表随数据快照更新。
openai · 闭源
1,050,000 tokens 上下文
参考输入 $10 / 百万 tokens
anthropic · 闭源
1,000,000 tokens 上下文
参考输入 $10 / 百万 tokens
qwen · 闭源
1,000,000 tokens 上下文
参考输入 $2 / 百万 tokens