英特尔今日宣布,为新一代开源多模态模型 MiniMax H3 提供
团队还结合 llm-scaler-omni 项目的 XPU Kernel 优化,对矩阵乘法、注意力等关键算子进行了持续优化,进一步提升 GPU 的计算效率,持续降低端到端推理时延,取得了良好的优化效果。
英特尔今日宣布,为新一代开源多模态模型 MiniMax H3 提供
团队还结合 llm-scaler-omni 项目的 XPU Kernel 优化,对矩阵乘法、注意力等关键算子进行了持续优化,进一步提升 GPU 的计算效率,持续降低端到端推理时延,取得了良好的优化效果。