Qian, Cheng

中文模型 C-Eval 评测结果简单小评测

最近 C-Eval 有较多中文开源模型打榜,分数一度超越 GPT-4,今天做一下简单的复盘。 首先排名靠前的几位全部是封闭模型,连API也不对外提供,无法进行评测。 顺序找下去,发现 ChatGLM2-6B 可以用,来做一次简单的分析。 评测大模型的能力,最难的莫过于逻辑能力和数学能力,我们用 ChatGPT 3.5对比,根据 C-Eval 官方榜单的详细评测项目: ...

大语言模型(LLM)微调技术笔记

注:本文大段摘抄自 1 图1:大模型进化树2 0x00 大模型微调 在预训练后,大模型可以获得解决各种任务的通用能力。然而,越来越多的研究表明,大语言模型的能力可以根据特定目标进一步调整。 这就是微调技术,目前主要有两种微调大模型的方法1: 指令微调,目标是增强(或解锁)大语言模型的能力。 对齐微调,目标是将大语言模型的行为与人类的价值观或偏好对齐。 在 Ope...