BAT 集体重做「AI 预训练」,补「脏数据」的坑
国内AI模型厂商密集启动预训练返工,主因是此前训练数据质量差、脏数据过多。互联网时代攒的数据不顶用,数据清洗成苦活,卡在钱与产能上。业内认为这是数据侧基建欠债还债,短期内难以根本改善。
AI 点评
国内AI模型厂商密集启动预训练返工,主因是此前训练数据质量差、脏数据过多。互联网时代攒的数据不顶用,数据清洗成苦活,卡在钱与产能上。业内认为这是数据侧基建欠债还债,短期内难以根本改善。
高春辉从技术上说,国内很多模型的数据清洗确实不行。互联网爬的数据噪音太大,脏数据喂进去模型也学垃圾,这不是堆参数能解决的,你明白吧
某高老师不是,这些厂商现在才意识到数据质量的重要性,之前都干嘛去了?这跟当年互联网烧钱获客一个德性,先圈地再说,哪管后面洪水滔天
朱峰其实就是数据侧的基建欠债,现在到了还债的时候,这场预训练返工大概率会持续一两年,且看
完整内容
可展开查看整理后的正文。
前往来源站点阅读全文 →