快讯 23:46Anthropic 拟登陆纳斯达克,连续两季盈利目标估值 2 万亿美元23:06英伟达联手 Perplexity:本地智能体 Portable Computer 登陆 Windows RTX PC23:05X与SpaceXAI撤回对苹果反垄断诉讼,继续追责OpenAI 全部快讯 →

每日快讯

大厂动态 · 融资事件 · 政策监管 · 前沿论文 · Agent 抓取 + 智能改写,每日 40+ 条

论文 今天 · 星期二 · 09-15 03:56 约 1 分钟读完

Entelligence实测:GPT-5.6 Luna代码评审成本仅0.2美元,精度74%

摘要

Entelligence在50个公开基准PR上对比GPT-5.6 Luna与GPT-6 Astra的代码评审能力。Luna发现69个经验证bug,精度74%,总成本0.20美元;Astra发现92个bug,精度96%,成本5.66美元。两者成本相差约28倍,为不同场景下的模型选型提供参考。

代码评审正成为大模型落地的重要场景之一。近日,Entelligence针对两款模型展开了一次横向评测,试图回答一个实际问题:低价模型能否胜任代码评审任务。

评测选取50个公开基准PR作为测试集,采用相同提示词,对比GPT-5.6 Luna与GPT-6 Astra的表现。结果显示,Luna共找到69个经验证bug,Astra则找到92个,两者在检出数量上存在差距。

精度方面,Luna为74%,Astra达到96%。成本差异更为显著:Luna总花费0.20美元,Astra为5.66美元,前者仅为后者的约二十八分之一。

这意味着在预算敏感或对精度要求相对宽松的场景中,低价模型具备一定可用性;而在需要高可靠性的评审流程里,高精度模型仍占据优势。评测数据为开发者在成本与效果之间的权衡提供了量化依据。

GPT-5.6 LunaGPT-6 Astra代码评审模型评测
本文由新大陆基于公开信息编辑整理
213
收录 AI 工具
23
模型产品档案
41
企业落地案例
4
完整版提示词