Ollaya:决策模型推理延迟仅10毫秒Ollaya是面向本地硬件的开源决策模型服务,用单次前向传播替代逐token生成,五个问题请求端到端约10毫秒。它提供兼容TypeSafe的端点,官方Python SDK 0.7.1可直接使用,支持Laya、decider、nli等开放模型。Hacker News · 46 小时前OllayaOllamaTypeSafe