开源项目
ggml-org/llama-connect:WebRTC点对点连接网页客户端与本地llama-server的桥接工具
ggml-org/llama-connect
概述
llama-connect出自ggml-org,目的是让网页UI通过WebRTC点对点连接本地运行的llama-server实例,适合演示或内网场景下把浏览器前端与本地推理服务直连。前端协议在llama.cpp仓库的PR #24577中定义。用法直接:假设llama-server跑在8080端口,执行llama-connect --port 8080,再打开仓库内examples/client.html示例页,聊天补全请求即经由WebRTC连接代理到本地llama-server。当前README篇幅很短,仅覆盖用途与最小演示,信令实现、鉴权方式、部署拓扑与适用限制等信息未披露,需阅读源码与配套PR进一步了解。