Unsloth开源决策模型微调教程:Qwen3.5 0.8B准确率跃升至74.3%
摘要
Unsloth发布教程与开源仓库,可将Qwen3.8、Gemma 4等LLM微调为输出选项概率的决策模型。其中Qwen3.5 0.8B在3个决策基准上的合计准确率从20.7%提升至74.3%,且仅需4GB显存即可完成本地训练。
近日,Unsloth 发布了一套面向决策模型训练的教程与开源仓库,旨在帮助开发者将通用大语言模型改造为能够输出选项概率的决策模型。该方案适用于 Qwen3.8、Gemma 4 等多种 LLM,为本地化微调提供了新的实践路径。
根据官方披露的数据,Qwen3.5 0.8B 模型在 3 个决策基准上的合计准确率由 20.7% 提升至 74.3%,性能改善显著。这一结果意味着小参数模型经过针对性微调后,在特定决策任务上能够达到可用的精度水平。
值得关注的是,整个训练过程仅需 4GB 显存,大幅降低了硬件门槛。开发者无需依赖高端 GPU 集群,即可在本地环境中完成模型微调,这对于资源有限的个人开发者或中小团队而言具有实际意义。
目前,相关教程与代码已在 Unsloth 的开源仓库中公开,具体微调流程与实现细节可参考官方发布内容。该方案为决策类任务的模型适配提供了一种轻量化思路,后续在更多模型与场景中的表现值得持续观察。
本文由新大陆基于公开信息编辑整理
信息来源:AIHOT AIHOT原文 ↗