Strata 为了降低显存占用,主要采用两项关键技术:其一是将 MoE模型整体载入 RAM,仅将高频使用的专家模型载入 VRAM。其二使用轻量模型进行投机解码,预测下一 Token 以加速推理过程。
这里的“写答案”对应生成回复的速度,“阅读提示”对应处理你输入的 prompt的速度。
Strata 为了降低显存占用,主要采用两项关键技术:其一是将 MoE模型整体载入 RAM,仅将高频使用的专家模型载入 VRAM。其二使用轻量模型进行投机解码,预测下一 Token 以加速推理过程。
这里的“写答案”对应生成回复的速度,“阅读提示”对应处理你输入的 prompt的速度。