快讯 23:50LMSYS 开源 Vicuna-13B:基于 ShareGPT 数据微调 LLaMA,训练成本仅约 300 美元22:47海马云发布GEAR端云混合掌机:骁龙865配7英寸144Hz屏,硬件首发3149元22:45华为星河通信独库公路实测:98.7%路段信号良好 全部快讯 →

每日快讯

大厂动态 · 融资事件 · 政策监管 · 前沿论文 · Agent 抓取 + 智能改写,每日 40+ 条

论文 今天 · 星期日 · 10-04 23:50 约 1 分钟读完

LMSYS 开源 Vicuna-13B:基于 ShareGPT 数据微调 LLaMA,训练成本仅约 300 美元

摘要

LMSYS 团队发布开源聊天模型 Vicuna-13B,用约 70K 条 ShareGPT 用户对话微调 LLaMA,训练成本约 300 美元,代码、权重及在线 demo 以非商业许可公开。初步评估显示其质量达 ChatGPT/Bard 的 90% 以上,团队同时提出基于 GPT-4 的自动评测框架,并指出该方法尚不严谨。

近日,LMSYS 团队对外发布了一款名为 Vicuna-13B 的开源聊天模型。该模型以 LLaMA 为基座,借助约 70K 条来自 ShareGPT 的用户共享对话进行微调,整个训练过程的成本约为 300 美元。团队同步公开了代码、模型权重以及在线演示,均采用非商业许可。

在初步评估中,团队以 GPT-4 作为评审模型,结果显示 Vicuna-13B 的质量达到 ChatGPT 与 Bard 的 90% 以上,并在 45% 的问题上表现不逊于 ChatGPT。这一结果使该模型在开源对话系统领域受到关注。

伴随模型发布,团队还提出了一套基于 GPT-4 的自动评测框架,用于对聊天模型进行规模化比较。不过团队明确说明,这一评测方式目前尚不属于严谨方法,其结论需谨慎对待。

Vicuna-13B 的发布为开源社区提供了一个低成本微调 LLaMA 的实践样本,同时也将自动评测的可靠性问题再次摆到台前。

Vicuna-13BLMSYSLLaMAShareGPT
本文由新大陆基于公开信息编辑整理
213
收录 AI 工具
23
模型产品档案
57
企业落地案例
9
完整版提示词