登录

推理


分类

芯片

上述细节的核心产业价值在于,K3不仅是单纯消耗算力资源的大模型,同时具备反向迭代算力基础设施的自举能力:技术团队基于MLIR开发轻量化类Triton编译器MiniTriton,向vLLM全球开源社区完整贡献KDA算子实现方案,同时自主设计适配轻量化KimiNano版本的专用推理芯片。
文章

芯片设计验证环节,依托开源EDA工具、Nangate45nm工艺库,自主完成一款专用推理芯片的架构设计、时序优化与功能验证。
文章

排队

服务器负载接近上限,推理排队时间拉长,现有GPU集群无法支撑调用量的指数级增长。
文章

公告发布的核心背景是K3上线48小时内用户调用请求量指数级增长,整体负载逼近现有GPU集群承载上限,推理排队、响应延迟问题凸显。
文章