地的核心问题之一。” 润色:“第二类做法是利用大模型对生成的数据进行打分和筛选。然而,这种评判标准通常是人类预先设定的静态规则,筛选逻辑无法随着模型能力的提升而自我演化。当模型变强后,旧的评估标尺会迅速失效,导致系统依然源源不断地产生低价值样本。此时,单纯依靠扩大数据集规模或对既有数据进行反复清洗,已很难推动模型能力的进一步跃升。如果训练数据仍依赖人类逐题生产,模型的进化速度就会被人类的出题速度所限制,
地的核心问题之一。” 润色:“第二类做法是利用大模型对生成的数据进行打分和筛选。然而,这种评判标准通常是人类预先设定的静态规则,筛选逻辑无法随着模型能力的提升而自我演化。当模型变强后,旧的评估标尺会迅速失效,导致系统依然源源不断地产生低价值样本。此时,单纯依靠扩大数据集规模或对既有数据进行反复清洗,已很难推动模型能力的进一步跃升。如果训练数据仍依赖人类逐题生产,模型的进化速度就会被人类的出题速度所限制,