大模型训练可“自动驾驶”,蚂蚁集团全面开源相关技术

数码
TIME
2024-02-05 10:25
通信世界全媒体
分享

近日,蚂蚁集团AI创新研发部门NextEvo全面开源AI Infra技术,可帮助大模型千卡训练有效时间占比超过95%,能实现训练时“自动驾驶”,这推动了AI研发效率。

该技术框架名为DLRover,目标在于大规模分布式训练的智能化。目前很多企业的训练作业都是跑在混合部署的集群中,运行环境复杂多变,不管多么“崎岖的地形”,DLRover都可以“轻松行驶”。

完成一个千亿参数级别的大模型,如GPT-3,用一张卡训练一次要耗时32年,那么训练时的算力利用尤为重要。方法之一是把能用的算力用得更好,比如进一步压榨已购买GPU的性能;二是把以前利用不了的算力用起来,比如CPU、内存等,这就需要通过异构计算平台来解决。

据悉,最新集成进DLRover的是Flash Checkpoint(FCP)方案。模型训练时,一般要打Checkpoint(检查点),以便中断时能恢复到最近状态,目前常规的做法,存在着耗时长、高频打点易降低训练可用时间、低频打点恢复时丢失过多等缺点。新方案FCP应用在千卡千亿参数模型训练后,Checkpoint 导致的训练浪费时间降低约5倍,其中持久化时间降低约70倍,有效训练时间从90%提升至95%。

THE END
免责声明:本文系转载,版权归原作者所有;刊载之目的为传播更多信息,如内容不适请及时通知我们。

相关热点

  半导体市场复苏的动力来自多方面。一是生成式人工智能持续火热,二是存储芯片去库存成效明显,三是消费电子产品特别是个人电脑和智能手机市场需求开始回暖。  韩国...
业界
  中新社北京2月3日电 北京商业航天产业高质量发展大会3日在北京经济技术开发区(简称北京亦庄)举办。大会发布“北京火箭大街共性科研生产基地项目”(简称“北京火箭...
业界

相关推荐

1
3