Ollaya:决策模型推理延迟仅10毫秒
Ollaya是面向本地硬件的开源决策模型服务,用单次前向传播替代逐token生成,五个问题请求端到端约10毫秒。它提供兼容TypeSafe的端点,官方Python SDK 0.7.1可直接使用,支持Laya、decider、nli等开放模型。
AI 日报收录的 Ollaya 相关报道,共 1 篇,按时间倒序,每小时更新。
Ollaya是面向本地硬件的开源决策模型服务,用单次前向传播替代逐token生成,五个问题请求端到端约10毫秒。它提供兼容TypeSafe的端点,官方Python SDK 0.7.1可直接使用,支持Laya、decider、nli等开放模型。