AI 公司 MosaicML 推出 70 亿参数模型 MPT7B8 号称一次处理 8000 字长文本、可商用
近日,AI创业公司MosaicML发布了其最新研发的参数模型MPT-7B-8K系列,这一创新技术的问世引起了业界广泛的关注。据悉,该系列模型由高达70亿参数构成,具有强大的文本处理能力,可一次性处理长达8000字的文本内容。不仅如此,它还能在处理长文重点摘要和问答方面表现出色。MosaicML公司通过精细的技术配置,使得这一模型可以在其平台上根据特定任务进行灵活调整和优化。
▲图源Huggingface
该系列模型训练过程相当复杂,采用了高达150万个Token,并在使用256块H100 GPU的支持下,耗时三天完成训练。此次发布会上,MosaicML推出了三个不同版本的模型,包括MPT-7B-8K、MPT-7B-8K-Instruct和MPT-7B-8K-Chat。其中每个版本都有其独特的特点和应用领域。
MPT-7B-8K版本基于Transformer解码器技术,并借助FlashAttention和FasterTransformer机制实现训练和推理的加速。这一模型不仅能够处理长篇文本内容,而且开源并允许商业使用。接下来是MPT-7B-8K-Instruct版本,它是在MPT-7B-8K基础上微调而成,特别注重于生成摘要和问答功能。同样地,该模型也是开源并且可商用的。
最后要介绍的是MPT-7B-8K-Chat版本,这是一款专为机器人对话设计的AI模型。据MosaicML公司介绍,该模型在训练过程中额外使用了高达15亿个聊天数据Token,基于MPT-7B-8K版本进行进一步的训练和优化。虽然这一模型开源,但并不允许商业使用。值得一提的是,MosaicML公司先前已经推出了一款成本仅为竞争对手零头的MPT-30B开源模型,并将所有开源模型发布在Huggingface平台上。感兴趣的用户可以前往该平台了解更多信息,并且可以在本地硬件上使用自己的数据对模型进行微调。这不仅展示了MosaicML的技术实力和创新精神,也为用户提供了更多选择和便利。