data 12
- Format Switch 的收益是 Ratio 调整的 8-60 倍: daVinci-LLM 200 次消融揭示的预训练数据工程三大定律
- Sample Packing + Attention Masking:未定义变量减少 52.7% 的预训练工程细节
- 目标数据重复 15-20 遍不过拟合:混合训练的 Scaling Law 推翻了'4 epoch 定律'
- 同样的数据重复 20 遍不过拟合?数据配比中那些反直觉的 Scaling Law
- 7B 模型重复 8 次只保留 25% 有效信息, 400M 保留 50%: 大模型比小模型对数据重复更敏感
- NVIDIA Nsight Systems 瓶颈分析全指南(实战版)
- 大语言模型高质量数据集汇总
- Embedding Model Fine-Tuning 案例
- 中文 Emebedding & Reranker 模型选型
- Gemini Pro Vision 作为 表格 OCR 解决方案的简单测试
- Embedding 模型在 RAG 场景下的评估和微调
- 大语言模型(LLM)后训练数据准备相关笔记