尧图精选

AIRI 网页版上手指南:从模型“大脑“到眼睛、耳朵与嘴巴的完整配置实战

🕒 发布时间:2026/9/12 17:22:57 📁 来源:尧图网络
AIRI 网页版上手指南从模型大脑到眼睛、耳朵与嘴巴的完整配置实战【免费下载链接】airi Self hosted, you-owned Grok Companion, a container of souls of waifu, cyber livings to bring them into our worlds, wishing to achieve Neuro-samas altitude. Capable of realtime voice chat, Minecraft, Factorio playing. Web / macOS / Windows supported.项目地址: https://gitcode.com/GitHub_Trending/ai/airi这篇指南以 AIRI 网页版apps/stage-web的官方手册为核心带你完成从零开始的完整上手流程先为 AIRI 配置大模型大脑再通过机体模块为它接入语音合成、语音识别与视觉能力最后用角色卡Character Card统一定义性格与各模块的模型偏好。读完本文你将掌握网页版的模型服务来源配置、TTS/STT 提供商接入、麦克风选择与角色卡编辑的完整实操路径并能结合仓库源码理解每一步背后的实现机制。欢迎来到 AIRIAIRI 网页版本身是一个空壳躯体——它拥有 Live2D/3D 形象、聊天面板、背景与语音交互能力但真正驱动对话的大脑大语言模型需要由你首次配置。页面会在初始化时引导你点击开始吧进入模型配置页这一步对应源码中的首次配置流程可参考 onboarding 状态存储完成后 AIRI 才能开始回应你的对话。第一步给 AIRI 一个大脑选择服务来源在模型配置页首先需要选择你的大模型服务来源Provider。网页版支持OpenAI官方 APIDeepSeek等国内主流模型服务Ollama本地模型服务以及所有兼容 OpenAI 格式的第三方 API 站点。这些可选项在仓库中分别对应独立的配置页面例如 Ollama 提供商配置页、官方提供商配置页以及用于任意 OpenAI 兼容端点的通用页[providerId].vue位于同一目录。选择来源后需要填写两项关键信息API 密钥API Key从服务商控制台申请用于鉴权Base URL仅在 OpenAI 兼容 API 时需要填写即大模型提供商的 API 端点地址。官方手册以**硅基流动SiliconFlow**为例演示了这一填写过程——它本质上是 OpenAI 兼容站点因此需要把硅基流动提供的端点填入 Base URL并粘贴对应的 API 密钥。从源码实现看任意 OpenAI 兼容提供商都会按 OpenAI 协议构造请求模型列表通过listModels拉取对话请求则经xsai/generate-text、xsai/stream-text等库发出见 apps/stage-web 依赖清单。这意味着只要端点兼容 OpenAI 格式理论上均可接入。选择模型配置好服务来源后从模型列表中选择一个你喜欢的 AI 模型作为 AIRI 的大脑。这里有一条官方提示值得留意::: tip 如果你使用的模型带有思考Reasoning功能生成回复可能需要很长时间。建议使用非思考模型以提高对话流畅度。 :::原因在于思考模型在回答前会先生成大量推理 token流式返回的首字延迟TTFT明显变长。如果你追求边聊边听的实时体验建议优先选择非思考模型或通过设置里的温度temperature/Top-P等采样参数调节回复风格——这些参数在首页语音输入与文本对话中统一生效见 consciousness 模块 中的activeTemperature、activeTopP状态。开始你的第一条对话完成模型配置后直接在首页对话框输入文字即可与 AIRI 对话。对话由 chat store 统一管理会话与流式输出AIRI 会以流式方式逐字生成回复。第二步眼睛、耳朵和嘴巴——机体模块文字对话之外AIRI 还提供了丰富的语音交互。点击页面右上角的设置 → 机体模块即可为 AIRI 添加各类交互能力。机体模块入口由useModulesList动态生成见 机体模块首页每个模块是一个可独立配置的器官对应仓库中packages/stage-pages/src/pages/settings/modules/目录下的独立页面。让 AIRI 开口说话发声 / TTS语音合成Text-to-Speech是让 AIRI开口的核心模块配置页为 speech.vue。点击发声进入语音合成配置。网页版自带了一个 Kokoro TTS 本地来源但它不支持中文因此需要点击新增一个支持中文的语音合成提供商来源填入新来源的相关内容API 密钥、端点等后回到发声页面在提供商列表中选择刚才新增的语音合成提供商即可生效。仓库中预置了大量 TTS 提供商模板例如 Kokoro 本地 TTS、VOICEVOX、ElevenLabs、OpenAI 音频语音 以及通用的 OpenAI 兼容语音合成 等均可作为新增来源。配置完成后发声模块还支持以下细节调节对应 speech 模块状态存储选择模型与音色Voice切换提供商后useSpeechStore会自动通过listProviderVoices拉取该提供商下的音色目录Voice Catalog并按配置指纹SHA-256缓存避免配置变化后使用过期音色见 provider store 中的音色目录实现音调Pitch与语速Rate默认音调为0、语速为1可通过滑块调节SSMLElevenLabs、Microsoft Speech 等提供商支持 SSML 标记可对语句进行更精细的韵律控制generateSSML会为支持的提供商生成speak/voice/prosody结构的 SSML 文档试听页面内置预览播放器可即时试听所选音色的效果。让 AIRI 听见声音听觉 / STT打字聊天有时候太麻烦这时就需要为 AIRI 配置语音转文字Speech-to-Text能力配置入口为听觉模块hearing.vue。浏览器自带的 STTWeb Speech API对中文的支持不完整因此依然需要点击新建一个转文字来源仓库提供了多种转文字提供商模板例如 浏览器 Web Speech API、OpenAI 音频转写、OpenAI 兼容转写 以及阿里云 NLS 实时转写等配置好语音转文字提供商后还需要选择一个可用的麦克风。你可以在 AIRI 首页对话框中点击麦克风图标来切换麦克风设备以及打开/关闭转文字开关。这条语音链路在源码中有完整实现见 首页 index.vueuseVAD使用 AudioWorklet 实现的语音活动检测VAD监听说话开始/结束Worklet 代码见 apps/stage-web/src/workers/vad说话结束时调用transcribeForRecording或流式转写transcribeForMediaStream将音频转为文本后通过chatStore.ingest送入对话——这就是按住麦克风说话AIRI 文字回复的完整闭环。让 AIRI 看见你视觉模块官方手册对此模块标注为未完工静待花开。从源码结构看视觉模块vision.vue及其底层编排器见 vision 模块存储已处于开发中配置页与模型提供商选择逻辑均已搭建但完整能力尚未开放可以持续关注后续版本。第三步角色卡Character Card内置角色卡 ReLUAIRI 内置了一张名为ReLU的角色卡你也可以自己为模型编写角色卡。切换方式有两种首页右上角的切换角色卡按钮或从设置中切换。从源码可见ReLU 是仓库中的默认角色卡初始化时会创建一张name: ReLU的默认卡见 airi-card.ts 中的默认卡定义卡片版本为1.0.0并在角色切换组件中作为默认展示见 character-switcher-drawer 测试。角色卡内容角色卡本质上是 AIRI 的人格配置文件包含名称name角色的名字描述description角色背景设定性格personality语气、说话风格、行为倾向等行为behavior角色在对话中的响应方式。这些内容高度自定义决定了 AIRI 的灵魂。角色卡通过extensions.airi扩展字段承载结构化的模块配置见 airi-card.ts并支持创建、编辑、删除与云端同步见 characters store 中的createCharacterStoreController。角色卡设置角色卡最强大的能力在于每张角色卡都可以为每个机体模块选择特定的模型提供商通过切换角色卡即可快速切换整套模型方案。以默认 ReLU 卡为例其extensions.airi.modules结构为{ consciousness: { provider: , model: }, speech: { provider: , model: , voice_id: }, vision: { provider: , model: } }也就是说一张角色卡可以同时记录思考用哪个模型consciousness说话用哪个 TTS 提供商和音色speech看东西用哪个视觉模型vision。例如你可以创建一张中文聊天专用卡搭配支持中文的 TTS 提供商再创建一张英文助手卡搭配 OpenAI 官方语音在首页右上角一键切换整套声音与模型偏好随之切换无需反复进入设置页逐个修改。需要注意的一个细节speech-noop是一个特殊占位提供商代表有意静音/未配置状态源码注释明确将其定义为Intentional mute切换角色卡时它会被视为未配置的发声状态而不是真正的语音提供商。结语至此你已经完成了 AIRI 网页版的三步配置为它接上大模型大脑、通过机体模块赋予它发声与听觉、再用角色卡把这一切组织成可一键切换的人格方案。后续无论是接入更多 OpenAI 兼容服务、更换 TTS 音色还是等待视觉模块的正式开放都可以在上述配置入口中随时调整。相关英文与日文版手册可分别在 英文文档 与 日文文档 查看桌面端Electron与移动端Capacitor的部署形态则可在 apps/stage-tamagotchi 与 apps/stage-pocket 中进一步探索。【免费下载链接】airi Self hosted, you-owned Grok Companion, a container of souls of waifu, cyber livings to bring them into our worlds, wishing to achieve Neuro-samas altitude. Capable of realtime voice chat, Minecraft, Factorio playing. Web / macOS / Windows supported.项目地址: https://gitcode.com/GitHub_Trending/ai/airi创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
上一篇/下一篇内容由系统自动关联 返回资讯列表 →