Tau本地推理指南:用内置llama.cpp后端在终端免费跑私有Coding Agent
Tau本地推理指南用内置llama.cpp后端在终端免费跑私有Coding Agent【免费下载链接】tauA Python port of Pi’s minimalist coding agent.项目地址: https://gitcode.com/gh_mirrors/tau16/tauTau 是一个运行在终端里的 Python Coding Agent它内置了 llama.cpp 本地推理后端。本指南带你用/local命令接入本机模型在不依赖云端 API 的前提下免费跑一个私有 Coding Agent——读文件、改代码、执行命令全部在本地完成代码与数据不出机器既保护隐私又零成本。为什么要在终端做本地推理云端大模型方便却有三个绕不开的痛点隐私你的源码会发到第三方服务器。成本按 token 计费重度使用账单可观。依赖网络断网或限流时助手直接罢工。Tau 的内置 llama.cpp 后端 正好解决这三点模型跑在你自己的显卡/统一内存上Tau 通过标准 OpenAI 兼容协议与它通信不联网、不收费、代码不出本机。 一句话理解架构tau_coding应用层→tau_agent可复用大脑→tau_ai模型传输层。本地推理只是tau_ai的一条动态 Provider通道核心循环完全复用云端模型那套事件流。准备工作安装 Tau 与 llama.cpp第一步安装 TauTau 以tau-ai包发布安装后即可得到tau命令需 Python 3.12uv tool install tau-ai # 或 pipx install tau-ai tau --version第二步准备 llama.cpp 推理服务器llama-server需要单独安装属于 llama.cpp 项目非 Tau 组件。Tau不会替你安装、启动或停止它你只需让它保持运行。官方推荐的路由模式启动方式——不带模型参数启动由服务器统一管理模型的下载/加载/卸载llama-server \ --models-max 1 \ --parallel 1 \ --flash-attn auto关键参数速记参数作用--models-max 1限制同时加载的模型数不是下载数单用户最稳--parallel 1把全部 KV 缓存留给单请求而不是分摊给并发槽位--flash-attn auto可移植默认值确认硬件支持后才可手动改on⚠️ 若显存充足、模型支持 65536 token 上下文可追加--ctx-size 65536 --cache-type-k q8_0 --cache-type-v q8_0使用长上下文档位。q8_0KV 缓存比默认f16更省显存且精度更好若加载失败优先调低--ctx-size。服务器默认监听http://127.0.0.1:8080。在 Tau 中配置/local连接本地模型Tau 用统一的 provider 无关入口/local管理本地后端没有/llama或/llama-cpp别名。内置 Provider ID 为llama.cpp。进入 Tau 后执行/local选择被标记为Recommended的llama.cpp后端并确认即使它当前是唯一选项也要确认保持入口的通用性。Tau 会按以下优先级探测有效端点只探测这一个地址绝不扫描端口、进程或局域网通过Configure提交的 URL已保存的端点当前进程的LLAMA_BASE_URL默认http://127.0.0.1:8080鉴权可选本地服务器通常无需密钥三种方式任选在/local的 secret 字段输入密钥 → 存到~/.tau/credentials.json设置环境变量LLAMA_API_KEY仅当次会话生效两者都留空 → 不发送Authorization头已保存的密钥优先于LLAMA_API_KEY。密钥绝不会写入 llama.cpp 状态文件、会话或诊断日志。选择并运行你的本地模型配置完成后用/model打开选择器会显示服务器真实上报的模型 ID 与显示名来自/v1/models无需伪造模型 ID。在脚本或新会话中建议显式指定最稳tau --provider llama.cpp --model model-id tau --provider llama.cpp --model model-id --print summarize this project规则要点Print 模式无头遇到多模型时必须给精确--modelTau 不会悄悄替你换一个模型。本地推理不是自动全局兜底——你没显式选它时它不会阻塞常规启动。已有安全快照时服务器短暂宕机也不影响显式启动。安全集成快照保存在~/.tau/state/extensions/llama.cpp.json只含归一化端点、所选模型引用、白名单元数据与时间戳带版本、加锁、原子替换且权限私有。进阶Router 模式下的模型管理与 Hugging Face 下载当/props识别出兼容的路由器受测构建区间b9688–b10595时/local会解锁完整管理能力不兼容的构建安全降级为只读的/v1/models发现推理仍可用。模型区与操作区分离方向键在区内移动、Tab直接切区只有聚焦区高亮加载/卸载对unloaded模型标为available to load按 Enter 审阅加载确认已有模型在运行时Tau 会问你保留还是卸载绝不替你决定。搜索 Hugging Face 模型输入关键词打开可方向键导航的仓库/量化列表展示门控状态与体积Q4_K_M仅作 UI 推荐。下载精确模型输入owner/repository[:quantization]先弹出确认框展示已知体积再请求服务器端下载。/local显示整行进度条与已传/剩余字节关闭窗口不会停止 llama.cpp 的下载重开会自动重新附着进度并可用Cancel active download…显式取消。 门控仓库需先在 Hugging Face 上接受条款。Tau 仅读取HF_TOKEN用于搜索不保存也不转发它真正下载的是独立运行的 llama.cpp 进程那个进程需要自己的HF_TOKEN。Doctor 诊断是显式动作独立报告端点可达性 → 模型发现 → 流式 → 工具 schema 接受 → 实际工具调用。模型能流式却不发探针工具时会给出兼容性警告而非连接失败并提示可能是 GGUF 聊天模板不支持工具。常见问题排查Troubleshooting现象解决连接被拒 / 超时先启动llama-server核对准确 URL再/local→ Refresh。Tau 不会探测别的端口HTTP 401/403在/local填入服务器密钥或设置LLAMA_API_KEY已存密钥优先显示 Loading等 llama.cpp 加载完再 Refresh下载时model limit reached共享路由器拒绝了请求查看/local仅在有意时卸载其他模型/v1/models为空/畸形检查服务器响应与模型加载状态Tau 不会编造 ID工具不被调用跑 Doctor流式正常但模板不支持工具换支持工具的 instruct GGUF 并核对模板/服务参数旧的llama-cppprovider 还在它是你手动配置的独立条目与内置llama.cpp并存验证新会话后可自行删除核心模块路径参考想读懂这套集成的实现可按下列路径入手内置后端注册入口llama_cpp/init.py服务与端点归一化llama_cpp/service.py状态与快照持久化llama_cpp/state.py路由器能力与版本门控llama_cpp/router.py用户文档随包内置data/docs/local-inference.md站点版指南guides/local-inference.md设计蓝本Issue #602 实现计划plans/602-built-in-local-inference.md小结只需三步就能在终端免费拥有一个不出门的私有 Coding Agentuv tool install tau-ai安装 Tau独立启动llama-server路由模式最省心在 Tau 里跑/local→ 选llama.cpp→/model开跑。隐私、成本、离线三件事一次性解决。【免费下载链接】tauA Python port of Pi’s minimalist coding agent.项目地址: https://gitcode.com/gh_mirrors/tau16/tau创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
上一篇/下一篇内容由系统自动关联
返回资讯列表 →