尧图精选

text-generation-webui 实战评测:十分钟从零跑通本地大模型推理界面,还送 OpenAI 兼容 API

🕒 发布时间:2026/8/31 8:10:23 📁 来源:尧图网络
text-generation-webui 实战评测十分钟从零跑通本地大模型推理界面还送 OpenAI 兼容 API【免费下载链接】textgenOpen-source desktop app for local LLMs. Text, vision, tool-calling, OpenAI/Anthropic-compatible API. 100% private.项目地址: https://gitcode.com/GitHub_Trending/te/textgenText-generation-webui现更名为 TextGen是一款本地大模型推理界面双击即用的一键部署内置 5 个推理后端还能直接顶替 OpenAI/Anthropic 的 API 端点。我用便携版和源码全量安装两种方式完整跑了一遍以下是实测结论和踩过的坑帮你判断它值不值得装。先说清它是什么本地推理 UI不只是个聊天窗口官方 README 的第一句话就是它的定位A desktop app for local LLMs. Open source, no telemetry.——纯离线、零遥测、不连外网。和同类工具相比它的差异点在于全对比 OllamaOllama 是命令行加极简 APITextGen 有完整的 Chat / Notebook / Parameters / Model / Training / Session 六个 Tab 界面支持 5 个后端——llama.cpp、ik_llama.cpp、Transformers、ExLlamaV3、TensorRT-LLM且切换后端和模型不需要重启服务。对比裸 Transformers 脚本它自带 OpenAI/Anthropic 兼容 API、工具调用、LoRA 训练 Tab、图像生成 Tab以及 TTS、语音输入等社区扩展。适合谁想要图形界面跑本地模型的新手想把现有 OpenAI 代码原地切到本地模型的开发者想顺手训个 LoRA 的进阶用户。从零跑通的最小路径便携版与全量安装两条路路径一便携版最省事推荐先试从 Release 下载对应平台的便携包解压双击textgen可执行文件窗口就打开了。便携版覆盖 CUDA、Vulkan、ROCm 和纯 CPU 四个选项依赖全部内置只认 GGUF 模型即 llama.cpp 格式。路径二源码全量安装git clone https://gitcode.com/GitHub_Trending/te/textgen然后运行对应系统的启动脚本Linux 用start_linux.shmacOS 用start_macos.shWindows 用start_windows.bat。按提示选择 GPU 厂商即可脚本用 Miniforge 在installer_files/里自动建好 Conda 环境完成后浏览器打开http://127.0.0.1:7860。README 明确说这些脚本不需要管理员权限。模型放哪下载 GGUF 文件放进user_data/models/目录界面会自动检测。多文件的 Transformers/EXL3 模型则放进该目录下的子文件夹——但这类格式必须走全量安装便携版加载不了。容易踩的坑便携版隐藏了训练、图像生成、TTS 扩展等高级功能README 用--portable标志明确标注了这一点。想要完整功能就选全量安装代价是约 10GB 磁盘和一次 PyTorch 下载。想固定启动参数比如每次自动加载某个模型不要记在脑子里写进user_data/CMD_FLAGS.txt每行一个参数下次启动自动生效。核心功能实战三个最值得用的功能1. 聊天 Tab三种模式 角色文件Chat Tab 文档把模式讲得很清楚instruct 模式指令遵循ChatGPT 式问答模板用 Jinja2 自动格式化chat-instruct / chat 模式和自定义角色对话。角色就是一个 YAML 文件放进user_data/characters/目录仓库里自带 Example.yaml 可参考里面定义name、greeting、context三个字段即可。细节功能比想象中实用消息可以编辑、可以回退到任意历史版本重新分支Branch还能给模型续写或移除上一轮。2. 工具调用开箱 5 个工具自定义只需一个 .py在聊天侧边栏勾选工具即可启用仓库 user_data/tools/ 自带 5 个web_searchDuckDuckGo 搜索、fetch_webpage、calculate、get_datetime、roll_dice。模型决定调用时会自动执行调用过程以折叠面板显示在聊天消息里。想加自己的工具按 工具调用教程 写一个单独的.py文件放进user_data/tools/里面只需要一个描述函数的tool字典和一个execute()函数。参考 get_datetime.py 的例子十几行就能跑起来。3. OpenAI/Anthropic 兼容 API一行 curl 就能验证启动参数加--apiAPI 默认监听 5000 端口提供 Chat、Completions 和 Anthropic Messages 三组端点支持 SSE 流式输出也支持工具调用。完整接口文档在http://127.0.0.1:5000/docs加--api-key可做鉴权加--nowebui则只跑 API 不启界面。实测把 OpenAI SDK 的 base_url 指向本机 5000 端口后原有代码无需改动。详见 OpenAI API 文档。后端怎么选一张表看清不同后端的能力差异不小What Works 文档给了官方支持矩阵后端加载 LoRA训练 LoRA视觉能力困惑度评测llama.cpp不支持不支持支持需 mmproj 文件不支持Transformers支持支持支持支持ExLlamav3_HF不支持不支持不支持支持ExLlamav3不支持不支持支持不支持TensorRT-LLM不支持不支持不支持不支持结论很简单只跑 GGUF 选 llama.cpp 系要 LoRA、训练、评测就选 Transformers。三个照做就有效的调优建议量化 KV 缓存省显存启动参数加--cache-type q8_0llama.cpp 支持 fp16/q8_0/q4_0 三档。README 的官方示例就是--model my-model.gguf加--cache-type q8_0两行写进CMD_FLAGS.txt显存占用明显下降速度损失很小。自动卸载闲置模型加--idle-timeout 30闲置 30 分钟后自动释放模型再次使用时自动重载。多模型用户必开。配合--gpu-layers -1自动分配 GPU 层数和--fit-target按 MiB 指定每块 GPU 预留显存余量基本不用手动算层数。投机解码提速无草稿模型方案直接加--spec-type ngram-mod帮助文档原话标注了Recommended: ngram-mod免费提速有合适的小模型时可用--model-draft指定草稿模型提速更明显。另外user_data/presets/ 自带三份采样参数预设Creative.yaml、Deterministic.yaml、Top-P.yamltop_p 0.95调参起步可以直接抄。坑与局限它做不了什么⚠️ 下面这些是实测或文档确认的限制选工具前先看llama.cpp 后端不加载 LoRA。你的工作流如果重度依赖 LoRA只能上 Transformers 后端显存要求高得多。训练 Tab 只支持 LoRA 微调不是全量 fine-tune且文档明确警告 CPU 上训练extremely slow别指望笔记本 CPU 练出什么。100% 离线是把双刃剑模型权重、视觉 mmproj 文件、LoRA 都得自己下载放进对应目录它对 Hugging Face 等外部源没有任何内置下载管理。多用户模式是无隔离的--multi-user适合小型可信团队聊天历史不保存也不自动加载别指望它做团队知识沉淀。联网功能依赖外网web_search 走 DuckDuckGo纯离线环境里工具调用只剩本地工具可用。一句话结论想要本地版 ChatGPT 界面 随时可用的 OpenAI 兼容端点先装便携版十分钟能跑要 LoRA 训练、多后端切换或长期当 API 服务上全量安装。这套本地推理界面目前属于同类里功能最全的一档——但它终究只是个工具回答质量上限还是由你选的模型决定的。【免费下载链接】textgenOpen-source desktop app for local LLMs. Text, vision, tool-calling, OpenAI/Anthropic-compatible API. 100% private.项目地址: https://gitcode.com/GitHub_Trending/te/textgen创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
上一篇/下一篇内容由系统自动关联 返回资讯列表 →