Qian, Cheng

中文 Emebedding & Reranker 模型选型

结论 选型建议: 大部分模型的序列长度是 512 tokens。 8192 可尝试 tao-8k,1024 可尝试 stella。 在专业数据领域上,嵌入模型的表现不如 BM25,但是微调可以大大提升效果。 有微调需求且对模型训练了解较少的,建议选择 bge 系列(完善的训练脚本、负例挖掘等)。但多数模型都基于BERT,训练脚本也通用,其他模型也可以参考。 重排模型选择...