Entelligence实测:GPT-5.6 Luna代码评审成本仅0.2美元,精度74%
摘要
Entelligence在50个公开基准PR上对比GPT-5.6 Luna与GPT-6 Astra的代码评审能力。Luna发现69个经验证bug,精度74%,总成本0.20美元;Astra发现92个bug,精度96%,成本5.66美元。两者成本相差约28倍,为不同场景下的模型选型提供参考。
代码评审正成为大模型落地的重要场景之一。近日,Entelligence针对两款模型展开了一次横向评测,试图回答一个实际问题:低价模型能否胜任代码评审任务。
评测选取50个公开基准PR作为测试集,采用相同提示词,对比GPT-5.6 Luna与GPT-6 Astra的表现。结果显示,Luna共找到69个经验证bug,Astra则找到92个,两者在检出数量上存在差距。
精度方面,Luna为74%,Astra达到96%。成本差异更为显著:Luna总花费0.20美元,Astra为5.66美元,前者仅为后者的约二十八分之一。
这意味着在预算敏感或对精度要求相对宽松的场景中,低价模型具备一定可用性;而在需要高可靠性的评审流程里,高精度模型仍占据优势。评测数据为开发者在成本与效果之间的权衡提供了量化依据。
本文由新大陆基于公开信息编辑整理
信息来源:AIHOT AIHOT原文 ↗