【小鹏在单颗图灵芯片上运行完整通用大模型 推理速度超20Tokens/秒】小鹏汽车通用智能中心负责人刘先明今日下午透露,小鹏已通过XLLM架构,在单颗图灵芯片上运行完整的通用大模型。该架构可在较短时间内对通用大模型进行优化,使其能够在单颗图灵芯片上高效运行,推理平均每秒生成超过20个Tokens,可用于类似ChatGPT、豆包的推理及应用。