LMSYS 开源 Vicuna-13B:基于 ShareGPT 数据微调 LLaMA,训练成本仅约 300 美元
摘要
LMSYS 团队发布开源聊天模型 Vicuna-13B,用约 70K 条 ShareGPT 用户对话微调 LLaMA,训练成本约 300 美元,代码、权重及在线 demo 以非商业许可公开。初步评估显示其质量达 ChatGPT/Bard 的 90% 以上,团队同时提出基于 GPT-4 的自动评测框架,并指出该方法尚不严谨。
近日,LMSYS 团队对外发布了一款名为 Vicuna-13B 的开源聊天模型。该模型以 LLaMA 为基座,借助约 70K 条来自 ShareGPT 的用户共享对话进行微调,整个训练过程的成本约为 300 美元。团队同步公开了代码、模型权重以及在线演示,均采用非商业许可。
在初步评估中,团队以 GPT-4 作为评审模型,结果显示 Vicuna-13B 的质量达到 ChatGPT 与 Bard 的 90% 以上,并在 45% 的问题上表现不逊于 ChatGPT。这一结果使该模型在开源对话系统领域受到关注。
伴随模型发布,团队还提出了一套基于 GPT-4 的自动评测框架,用于对聊天模型进行规模化比较。不过团队明确说明,这一评测方式目前尚不属于严谨方法,其结论需谨慎对待。
Vicuna-13B 的发布为开源社区提供了一个低成本微调 LLaMA 的实践样本,同时也将自动评测的可靠性问题再次摆到台前。
本文由新大陆基于公开信息编辑整理
信息来源:AIHOT AIHOT原文 ↗