热门搜索:和平精英 原神 街篮2 

您的位置:首页 > > 教程攻略 > ai资讯 >Qwen1.5-MoE模型:2.7B的激活参数量达到7B模型的性能

Qwen1.5-MoE模型:2.7B的激活参数量达到7B模型的性能

来源:互联网 更新时间:2026-07-31 13:22

Qwen1.5-MoE模型:2.7B的激活参数量达到7B模型的性能

Qwen1.5-MoE模型:2.7B的激活参数量达到7B模型的性能

写在前面

阿里今天放出了MoE版本的模型,总参数量14.3B,内部配备了64个专家,每次推理激活8个。有意思的是,在仅激活2.7B参数的情况下,它的表现居然能直接媲美Qwen1.5-7B模型。更别提训练成本直接砍掉75%,推理速度也飙升至原来的1.74倍。阿里同步开源了Base版和Chat版,值得上手试试。

需要说明的是,以下内容主要参考自Qwen官方博客,但会尽量用更直白的语言把关键点讲清楚。

模型结构

相比Mistral-MoE那种固定8个专家、用Top-2门控选专家的方案,Qwen1.5-MoE做了几个关键改进:

  • 细粒度专家细分:

    把原本一整块的FFN拆成多个小段,每一段都独立当作一个专家。这样一来,专家的粒度更细,组合更加灵活。
  • 模型初始化优化:

    直接用Qwen-1.8B模型的参数来初始化Qwen1.5-MoE-A2.7B,并且在初始化阶段加入了随机参数。这招不仅让模型收敛得更快,预训练的整体效果也顺带提升了。
  • 共享路由机制:

    把共享专家和路由专家揉在一起。模型始终有4个共享专家处于激活状态,然后从剩下的60个路由专家里再挑4个激活。简单说,就是“常驻+动态”的组合拳。

实验效果

在MMLU、GSM8K、HumanEval以及多语言榜单上,团队分别测试了Qwen1.5-MoE-A2.7B的语言理解、数学、代码和多语言能力。同时用MT-Bench给Chat版模型打了分。结果很明显——这个2.7B激活参数的MoE模型,效果完全可以和目前最好的7B模型掰手腕。

虽然MoE模型的总参数量看着不小,但实际激活的参数远小于7B模型。再加上初始化方法省去了大量冗余训练,整体训练成本砍掉了75%——这个数字在工程落地时相当有吸引力。

在A100-80G显卡上,用vllm框架分别测了Qwen1.5-7B和Qwen1.5-MoE-A2.7B的推理性能。输入和输出token都固定在1k的情况下,具体TPS数据如下:MoE版本比7B版本推理速度快了约1.74倍。换句话说,同样跑一次推理,MoE能省将近一半的时间。

模型推理

下面直接用Transformers跑一下Qwen1.5-MoE-A2.7B的推理流程,代码很直白,复制就能用:

from transformers import AutoModelForCausalLM, AutoTokenizer
device = "cuda" # the device to load the model onto

model = AutoModelForCausalLM.from_pretrained(
    "Qwen/Qwen1.5-MoE-A2.7B-Chat",
    torch_dtype="auto",
    device_map="auto"
)
tokenizer = AutoTokenizer.from_pretrained("Qwen/Qwen1.5-MoE-A2.7B-Chat")

prompt = "Give me a short introduction to large language model."
messages = [
    {"role": "system", "content": "You are a helpful assistant."},
    {"role": "user", "content": prompt}
]
text = tokenizer.apply_chat_template(
    messages,
    tokenize=False,
    add_generation_prompt=True
)
model_inputs = tokenizer([text], return_tensors="pt").to(device)

generated_ids = model.generate(
    model_inputs.input_ids,
    max_new_tokens=512
)
generated_ids = [
    output_ids[len(input_ids):] for input_ids, output_ids in zip(model_inputs.input_ids, generated_ids)
]

response = tokenizer.batch_decode(generated_ids, skip_special_tokens=True)[0]

写在最后

最近开源的MoE模型真是越来越多。前脚Grok-1是MoE,后脚DBRX的132B也是MoE,现在千问也跟上了。不过说实话,有时候会觉得MoE模型多少带点“投机取巧”的味道——当然,这只是个人感受,保命要紧。

关于宇宙的好的网名有哪些
关于宇宙的好的网名有哪些

类型:角色扮演

大小:1

语言:简体中文

平台:互联网

游戏下载

热门手游

手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc