语聊大模型
YuChat Sub2API Provider 是一个 VS Code 语言模型供应商插件,可将语聊大模型接入接入 VS Code Chat。插件支持 OpenAI Responses、OpenAI Chat Completions 和 Anthropic Messages 协议,并提供模型管理、连接测试、用量查询、推理强度选择和上下文管理。
功能
- 支持流式文本、图片输入和工具调用
- 支持 OpenAI Responses、Chat Completions 和 Anthropic Messages
- API Key 存储在 VS Code SecretStorage,不写入普通设置
- 显示请求用量、缓存命中率和服务端返回的额度信息
- 支持推理强度选择、上下文自动裁剪和下一次请求压缩
- 支持连接、网络和并发限制重试
- 提供中文和英文界面文本
环境要求
- VS Code
1.125.0 或更高版本
- 可访问的
https://sub2api.yuchat.top 服务
- 对应服务的 API Key
快速开始
- 打开模型管理面板,点击右上角的添加模型,选择
语聊大模型。
- 选择
配置API Key,输入语聊大模型后台的API Key。
- 进入“模型管理”,勾选需要在 Chat 中使用的模型。
- 打开 VS Code Chat,从模型选择器中选择“语聊大模型”提供的模型。
模型管理列表中的每个模型右侧都有齿轮按钮,可以单独配置显示名称、上下文窗口、最大输出 Token、默认思考级别、图片输入和工具调用。显示名称留空时使用上游名称,其他未配置字段继续使用全局默认值;也可以通过“恢复模型默认配置”删除该模型的全部覆盖设置。
常用命令
在命令面板中搜索 YuChat Sub2API:
| 命令 |
作用 |
| 管理 |
打开插件统一管理菜单 |
| 模型管理 |
获取模型列表并选择要启用的模型 |
| 配置端点 |
设置 API 基础地址或完整推理地址 |
| 设置 API 密钥 |
新增、修改或删除 API Key |
| 测试连接 |
使用选定模型发送测试请求 |
| 查看日志 |
打开 语聊大模型 输出通道 |
| 查看用量 |
查看用量、余额和会话 token 统计 |
| 刷新用量 |
立即刷新服务端用量信息 |
| 选择推理强度 |
选择后续请求使用的推理强度 |
| 管理上下文 |
控制自动裁剪或压缩下一次请求 |
| 重置缓存兼容性 |
重新检测上游提示词缓存能力 |
配置项
在 VS Code 设置中搜索 yuchat.sub2api:
| 配置项 |
默认值 |
说明 |
baseUrl |
https://sub2api.yuchat.top |
语聊大模型的服务器地址 |
apiFormat |
openai-responses |
上游通信协议 |
contextWindowCap |
0 |
上下文窗口上限;0 表示使用插件声明的限制 |
maxOutputTokens |
32768 |
单次请求的最大输出 token 数 |
includeEncryptedReasoning |
true |
请求并回放模型支持的加密推理内容 |
promptCacheMode |
auto |
提示词缓存策略:auto、explicit 或 off |
promptCacheScope |
family |
缓存键按模型族或模型 ID 隔离 |
requestTimeoutSeconds |
600 |
上游请求超时时间,单位为秒 |
concurrencyRetryCount |
3 |
上游并发限制的重试次数 |
concurrencyRetryDelaySeconds |
3 |
并发限制重试的基础延迟,单位为秒 |
connectionRetryCount |
3 |
请求到达上游前连接失败的重试次数 |
connectionRetryDelaySeconds |
1 |
连接重试的基础延迟,单位为秒 |
networkRetryCount |
0 |
网络瞬时错误的重试次数 |
networkRetryDelaySeconds |
2 |
网络重试的基础延迟,单位为秒 |
debugLogging |
false |
将请求元数据和 SSE 事件写入输出通道 |
contextSafetyMarginTokens |
8192 |
从上下文窗口中预留的安全 token 数 |
usageEndpoint |
auto |
用量接口地址;auto 自动推导 /v1/usage |
usageRefreshMinutes |
5 |
自动刷新用量的间隔;0 表示禁用 |
reasoningOverride |
model |
覆盖请求推理强度,或跟随所选模型 |
contextTrimMode |
auto |
自动裁剪上下文,或关闭插件侧裁剪 |
requestSafetyRatio |
0.85 |
自适应上下文裁剪使用的安全比例 |
推理强度
可以通过“选择推理强度”命令设置:
- 跟随所选模型
- Low
- Medium
- High
- XHigh
- Max
所选值会用于后续请求。不同协议会转换成各自支持的推理参数。
上下文管理
“管理上下文”提供以下操作:
- 自动裁剪:接近安全输入预算时裁剪较旧消息
- 关闭自动裁剪:发送完整上下文,由上游决定是否接受
- 压缩下一次请求:仅下一次请求移除最旧的一部分消息
- 打开上下文设置:调整窗口上限、安全余量和裁剪比例
安全说明
- API Key 使用 VS Code SecretStorage 保存,不会写入
settings.json。
- 日志不会主动输出完整 API Key;模型请求日志只记录用于排障的元数据。
- 插件会将 Chat 内容发送到配置的API服务,请确认该服务的隐私、数据保留和计费政策。
- 请勿在端点 URL 中嵌入用户名、密码或其他凭据。
修改设置后没有生效
运行“管理”重新选择模型,或者执行“Developer: Reload Window”重新加载 VS Code 窗口。
许可证
MIT
| |