AI模型参考AI模型参考
模型榜定期更新
首页/编程与代码审查
AI 模型选型

编程与代码审查

用真实仓库的小任务评估正确性、修改范围和总成本。

AI模型参考 · · 候选快照 2026-09-16

先写验收,再选模型

选择一个能在本地复现的问题,记录环境、依赖版本、复现步骤和预期行为。修复任务的合格标准应包括原有测试继续通过、新问题被覆盖,以及没有不相关修改。

候选依据和边界

候选依据本站编程参考榜。不同公开评测的任务范围并不相同,网页生成表现不能直接代表大型仓库维护能力。请使用与你的语言、框架和代码规模接近的任务再验证。

如何做公平比较

向每个模型提供相同的代码、限制条件与测试命令。保存第一次输出及后续修复轮次,分别记录测试通过情况、人工修改量和累计输入输出。运行生成代码时使用隔离环境,不把通过文字自述当成通过测试。

如何算一次完成的成本

先估算每次调用输入与输出,再乘以实际调用次数。还要记录失败重试和工具返回占用的上下文。可在成本工具中分别建立少轮次与多轮次两种预算场景。

资料与验证依据

候选采用本站公开参考数据;本文没有把榜单名次当作本站任务实测结果。

可进一步比较的候选模型

依据编程参考榜筛选,列表随数据快照更新。