中文模型 C-Eval 评测结果简单小评测
最近 C-Eval 有较多中文开源模型打榜,分数一度超越 GPT-4,今天做一下简单的复盘。 首先排名靠前的几位全部是封闭模型,连API也不对外提供,无法进行评测。 顺序找下去,发现 ChatGLM2-6B 可以用,来做一次简单的分析。 评测大模型的能力,最难的莫过于逻辑能力和数学能力,我们用 ChatGPT 3.5对比,根据 C-Eval 官方榜单的详细评测项目: ...
最近 C-Eval 有较多中文开源模型打榜,分数一度超越 GPT-4,今天做一下简单的复盘。 首先排名靠前的几位全部是封闭模型,连API也不对外提供,无法进行评测。 顺序找下去,发现 ChatGLM2-6B 可以用,来做一次简单的分析。 评测大模型的能力,最难的莫过于逻辑能力和数学能力,我们用 ChatGPT 3.5对比,根据 C-Eval 官方榜单的详细评测项目: ...
本文是对 LLM 进行微调以及二次预训练时,阅读数据训练相关文章的一些学习笔记,包含极少的经验总结。 参考资料: Streamlining Data Preparation for Fine tuning of Large Language Models Processing Data for Large Language Models OpenAI Fine-tuning...
Updated 2023.7.13: 增加 baichuan-13B-Chat、InternLM 模型 2023.6.25: 增加 ChatGLM2-6B、Vicuna-33B-v1.3 模型 2023.6.24: 增加 MPT-30B/MPT-30B-Chat 模型 模型推理 建议使用通用的模型推理工具包运行推理,一般都提供较好的UI以及兼容Op...
注:本文大段摘抄自 1 图1:大模型进化树2 0x00 大模型微调 在预训练后,大模型可以获得解决各种任务的通用能力。然而,越来越多的研究表明,大语言模型的能力可以根据特定目标进一步调整。 这就是微调技术,目前主要有两种微调大模型的方法1: 指令微调,目标是增强(或解锁)大语言模型的能力。 对齐微调,目标是将大语言模型的行为与人类的价值观或偏好对齐。 在 Ope...
SSH port forwarding is a powerful tool for securely tunneling network traffic. Here are three common types—local (-L), remote (-R), and dynamic (-D)—explained with practical use cases. 1. Local Fo...