分类: AI

  • LM Studio 本地大模型教程:VS Code 使用 Claude Code 实现本地 LLM 调用与部署

    通过 LM Studio 的 Anthropic‑兼容本地服务,将本地 LLM 模型与 Claude Code 集成,使用户能够在 VS Code 或终端 中直接调用本地部署的语言模型进行交互。实现与本地模型的对接。支持更大的上下文长度、流式输出和函数调用等高级功能

    1. 环境说明

    • 操作系统:Windows 11
    • 本地模型工具:LM Studio
    • 编辑器:Visual Studio Code
    • VSCode 插件:Claude Code

    2. 安装 LM Studio

    2.1 下载并安装

    1. 访问 LM Studio 官网,下载 Windows 版本安装包。
    2. 安装完成后启动 LM Studio。
    3. 在“Models”页面下载大模型,例如:
       openai/gpt-oss-20b

    2.2 开启 Developer Mode(本地 API 访问)

    1. 打开:
       Settings → Developer → Local Server
    1. 设置监听地址:
       http://localhost:1234
    1. 启动 API Server,确保浏览器或 VSCode 可以访问:
       http://localhost:1234

    2.3 加载模型

    1. 点击 Load Model
    2. 选择模型:
       openai/gpt-oss-20b
    1. 设置模型参数:
    • Context length:100000
    • GPU Offload:16 (根据显存大小调整)

    ⚠️ 注意:20B 模型对显存要求高,建议显卡显存≥24GB,或者使用 CPU Offload 功能。

    3. VSCode 配置 Claude Code

    3.1 安装插件

    1. 打开 VSCode。
    2. 扩展市场搜索:
       Claude Code
    1. 点击安装。

    3.2 配置环境变量

    1. 打开命令面板:Ctrl + Shift + P
    2. 输入:
       Preferences: Open Settings (JSON)
    1. 添加以下配置:
    {
        "workbench.colorTheme": "Experimental Light",
        "claudeCode.preferredLocation": "panel",
        "claudeCode.environmentVariables": [
            {
                "name": "ANTHROPIC_BASE_URL",
                "value": "http://localhost:1234"
            },
            {
                "name": "ANTHROPIC_AUTH_TOKEN",
                "value": "lmstudio"
            }
        ]
    }

    3.3 测试连接

    1. 在 VSCode 中打开 Claude Code 面板。
    2. 尝试发送一条简单的指令,例如:
       Hello
    1. 如果能正确返回结果,说明 VSCode 已经成功连接到本地 LM Studio 模型。
  • Token 预算是 AI 系统真正的硬约束

    Token 预算是大语言模型(LLM)系统中的核心硬约束,直接限制每次交互可使用的 Token 数量,包括输入、输出及工具调用。它不仅影响计算成本和延迟,也决定系统可用性与任务成功率。有效管理 Token 预算依赖上下文压缩(Summarization、关键状态保留、递归编码)、动态分配策略以及实时消耗监控。在多轮对话、RAG 系统和 LLM Agent 架构中,预算驱动设计可保证信息完整性、生成稳定性和成本可控性。长期优化 Token 使用效率是系统可扩展性、可控性和可靠性提升的关键。

    概念

    Token Budget(Token 预算):在大语言模型(LLM, Large Language Model)系统中,Token 预算指每次模型交互允许消耗的最大 Token 数量,包括输入 Prompt 和模型输出。Token 预算是对计算资源、延迟和成本的直接约束,而非单纯的文本长度限制。

    Token Cost:Token 的计算成本由模型架构、序列长度和硬件资源决定。长序列不仅增加推理时间,也会线性或超线性地增加 GPU 显存占用和运行成本。

    Context Compression(上下文压缩):在 Token 预算限制下,为保持任务信息完整性,需要对历史上下文进行策略性压缩,包括摘要(Summarization)、选择性保留关键状态和递归编码。

    Token-Budget-Driven Design(Token 预算驱动设计):系统架构需以 Token 预算为硬约束来规划任务拆分、状态管理、工具调用和多轮交互流程。

    运作机制

    1. Token 消耗结构分析
    • Input Tokens:用户输入、系统指令、历史上下文。
    • Output Tokens:模型生成的响应。
    • Overhead Tokens:控制符、特殊标记和工具接口调用占用的 Token。
    1. 预算分配策略
    • 静态分配(Static Allocation):为 Prompt、上下文和输出分别预设 Token 上限。适用于确定性任务或单轮交互。
    • 动态分配(Dynamic Allocation):根据任务复杂度、上下文信息密度或工具调用需求动态调整 Token 上限。适用于多轮任务或 Agent 系统。
    1. 上下文压缩方法
    • 摘要压缩(Summarization):将多轮历史对话或文档内容生成简短表示。
    • 关键状态保留(Key-State Retention):只保留对任务决策至关重要的信息。
    • 递归编码(Recursive Encoding):将长序列内容编码成向量或标记化形式,以减少 Token 占用。
    1. Token 消耗监控与反馈
    • 实时跟踪输入、输出和工具调用的 Token 消耗。
    • 根据预算消耗自动触发上下文压缩或任务拆分机制。
    • 对多轮系统提供 Token 使用报告,用于优化系统设计和提示工程(Prompt Engineering)。

    实际应用

    1. 多轮对话系统
    • 确保对话状态管理在 Token 预算内,防止长轮次交互导致上下文截断或生成失败。
    • 对重要信息使用递归摘要,实现长期对话记忆。
    1. RAG 系统(Retrieval-Augmented Generation)
    • 限制检索内容长度,使向模型提供的文档片段不会超过预算。
    • 在检索-生成闭环中动态分配 Token,保证生成质量和上下文完整性。
    1. LLM Agent 架构
    • 工具调用前评估输出 Token 需求,避免因生成过长导致预算溢出。
    • 复杂任务拆解为子任务,每个子任务对应独立 Token 预算管理,确保整体系统稳定。
    1. 成本控制与可扩展性
    • Token 预算直接对应云计算成本,可用于实时估算系统运行成本。
    • 对大规模部署和高并发场景,Token 预算是保证系统稳定性和可预测性的核心指标。

    深刻的见解/反思

    • Token 预算是系统设计的根约束:与模型参数、算法优化相比,Token 预算直接影响系统的可用性、响应时间和成本。任何忽略 Token 预算的系统设计必然导致性能退化或任务失败。
    • 设计思路应“预算优先”:在多轮交互、复杂任务或 Agent 系统中,先规划 Token 预算,再设计上下文管理、工具调用和生成策略,比先生成内容再裁剪更高效。
    • Token 使用效率是长期优化核心:通过上下文压缩、关键状态保留和动态分配,系统可以在固定预算下提高信息利用率和任务成功率。
    • Token 预算驱动的架构演化:随着任务复杂性增加,系统设计会趋向模块化、可递归的上下文管理结构,实现“预算可控 + 信息完整”的最佳平衡。
    • Token 与 AI 可控性关联:预算限制迫使系统选择信息优先级、明确工具调用边界,从而提升生成内容的可靠性和决策可解释性。
  • ComfyUI 更新到最新版本教程

    已安装 ComfyUI 的情况下更新到最新版本,不包含首次安装与环境创建步骤。

    一、更新 ComfyUI

    激活 Conda 环境

    conda activate comfyui

    如果你的环境名不是 comfyui,请替换为实际名称。

    进入 ComfyUI 目录

    cd ComfyUI

    拉取最新官方代码

    git pull

    更新 Python 依赖库

    pip install -r requirements.txt --upgrade

    二、更新完成后启动

    python main.py

    浏览器访问:

    http://127.0.0.1:8188
  • 从 0 到 1:使用 Qwen CLI 快速搭建炫酷个人主页

    想拥有一个效果炫酷的个人页面,却对编程一窍不通?没关系!带你一步步使用强大的 Qwen CLI 工具,让你在 20 分钟内,亲手完成制作个人主页的全过程。

    前提条件

    在开始之前,请确保你已准备好以下环境:

    1. 一台可以正常联网的电脑
      Qwen CLI 在写代码时需要联网。
    2. 操作系统和终端支持中文/英文显示
      确保你的操作系统(Windows/macOS/Linux)和终端可以正常显示和输入中英文字符。

    第一步:注册Qwen 账号

    首先,你需要一个Qwen的账号来授权 CLI 工具。

    1. 访问官网:使用 Chrome 浏览器
    2. 完成注册/登录:点击页面右上角的 “登录 / 注册” 按钮,按照指引完成账号创建。
    3. 记住账号信息:请记住你的注册方式(如手机号或邮箱),后续 CLI 登录会用到。

    第二步:安装 Node.js (CLI 的运行环境)

    Qwen CLI 是基于 Node.js 开发的,因此我们需要先安装这个运行环境。

    1. 访问下载页:打开 Node.js 官方下载页面
    2. 选择 LTS 版本:根据你的操作系统(Windows / macOS / Linux)下载 LTS (长期支持) 版本,这是最稳定和推荐的版本。
    3. 执行安装:双击下载的安装包,安装过程中保持默认选项,一路点击“下一步”即可。
    4. 验证安装:安装完成后,打开你的终端(或命令提示符),分别输入并执行以下两个命令:
    # 检查 Node.js 和 npm 版本
    node -v
    npm -v

    如果终端分别显示版本号,那就说明 Node.js 环境已成功安装!

    第三步:安装 Qwen CLI (核心工具)

    现在,我们可以安装主角——Qwen CLI 了。

    1. 打开终端:
    • Windows: 按 Win + R 键,输入 cmd 后回车。
    • macOS: 打开“应用程序” -> “实用工具” -> “终端 (Terminal)”。
    • Linux: 打开终端
    1. 执行安装命令:在终端中,输入以下命令并回车,它会从网络上下载并全局安装 Qwen CLI。
    npm install -g @qwen-code/qwen-code@latest
    1. 验证安装:安装完成后,输入以下命令验证:
    qwen --version

    如果显示出版本号,说明 Qwen CLI 已成功安装。

    第四步:登录你的 Qwen 账号

    在使用前,需要让 CLI 工具获取你的账号授权。

    1. 启动登录流程:在终端中,直接输入 qwen 命令并回车。
    qwen
    1. 浏览器授权:
    • CLI 会自动在你的默认浏览器中打开一个授权页面。
    • 如果你已在浏览器中登录了 Qwen 账号,只需点击 “授权” 即可。
    • 如果未登录,请先在网页上登录你的 Qwen 账号,然后进行授权。
    • 授权成功后,网页会提示“登录成功”,此时你可以关闭该网页。
    1. 返回终端:你会看到终端显示登录成功的欢迎信息,这表示 CLI 已经准备就绪!

    第五步:开始编程 – 创建你的个人主页项目

    最激动人心的部分来了!我们将用一句话让 Qwen CLI 为我们创建项目。

    1. 发送指令:在终端里,像聊天一样对 Qwen CLI 说出你的需求。你可以大胆发挥想象力,指令描述得越具体、越清晰,生成的效果可能就越符合你的预期!
    帮我使用nodejs制作个人介绍页面,使用中文语言,页面炫酷漂亮
    1. 确认项目创建:Qwen CLI 会理解你的需求并自动创建项目名称。
    2. 进入项目目录:项目创建完成后,根据提示按回车确认最终完成后终端会显示一个本地网址,通常是 http://localhost:3000
    3. 在浏览器中打开这个网址,你就能看到你的个人主页的雏形了!最棒的是,当你修改内容时在终端对话框输入你要表述的即可
  • 在 VS Code编辑器中使用 LM Studio API + Continue 打造智能开发环境

    在日常开发中大语言模型(LLM)已经成为许多开发者的得力助手。LM Studio 提供了本地运行大模型的能力,而 Continue 插件则能在 VS Code 中无缝调用这些模型,带来智能补全、对话和代码生成体验。通过 Continue 插件接入 LM Studio 的 API,我们可以让本地或局域网部署的 AI 模型无缝集成到开发环境中。

    这种组合不仅能提供媲美云端的 AI 开发体验,还能保障数据隐私、不依赖外网。在代码补全、错误排查、文档生成等场景中,都能显著提升效率。

    一、准备工作

    1. 安装 LM Studio
    • 前往 LM Studio 官网下载并安装。
    • 启动后,根据需求下载模型(如 gpt-oss-20bQwen 等)。
    1. 安装 VS Code 与 Continue 插件
    • 打开 VS Code → Extensions → 搜索 Continue 并安装。
    • 安装完成后,左侧工具栏会出现 Continue 图标。

    二、启动 LM Studio API 服务

    1. 打开 LM Studio,进入 开发者模式
    2. 加载所需模型(例如 gpt-oss-20b)。
    3. 启动 API 服务,默认会监听本地或局域网 IP 上的指定端口,例如:
    http://192.168.1.100:1234/v1

    三、配置 Continue 插件

    Continue 的配置文件默认路径如下:

    • Windows: C:\Users\<用户名>\.continue\config.yaml
    • macOS/Linux: ~/.continue/config.yaml

    示例配置:

    name: Local Agent
    version: 1.0.0
    schema: v1
    models:
      - name: gpt-oss-20b
        provider: lmstudio
        model: openai/gpt-oss-20b
        apiBase: http://192.168.1.100:1234/v1/

    ⚠️ 注意:如果需要局域网访问,请将 localhost 替换为实际 IP 地址。

    四、开始使用

    1. 打开 VS Code,点击左侧 Continue 图标。
    2. 在对话框中选择你配置好的模型(如 gpt-oss-20b)。
    3. 输入问题,即可与模型对话,体验智能补全、调试和代码生成。
  • 在 Zed编辑器中集成本地 AI:配置 Zed 编辑器 + LM Studio API

    AI 助手在开发领域的普及越来越多的开发者开始依赖它们来提升编码效率。Zed 作为一款现代、轻量且速度极快的编辑器,不仅界面优雅,还原生支持接入远程 AI 模型,为我们提供了一个绝佳的平台。

    如果您在享受 AI 带来的便利时,又对数据隐私、网络延迟或 API 费用心存顾虑,那么将 Zed 编辑器 与 LM Studio 结合将是一个完美的解决方案。通过在本地或局域网中部署私有 AI 模型,可以在 Zed 编辑器中无缝使用 AI 辅助开发,既安全又高效。

    配置 Zed 编辑器 + LM Studio,让本地或局域网部署的 AI 模型无缝集成到开发环境中。

    配置步骤

    1. 启动 LM Studio API 服务

    您需要在 LM Studio 中启动一个本地 API 服务。

    1. 打开 LM Studio,进入开发者模块。
    2. 加载您所需的 AI 模型,例如 gpt-oss-20b。
    3. 启动 API 服务。该服务会默认监听您本地或局域网 IP 上的指定端口。

    例如

    http://192.168.1.100:1234/api/v0

    2. 修改 Zed 配置文件

    Zed 的配置文件在:

    • macOS / Linux: ~/.config/zed/settings.json
    • Windows: %APPDATA%\Zed\settings.json

    在配置文件中,添加以下核心配置:

    // Zed settings
    {
      "agent": {
        "inline_assistant_model": {
          "provider": "lmstudio",
          "model": "openai/gpt-oss-20b"
        },
        "default_model": {
          "provider": "lmstudio",
          "model": "openai/gpt-oss-20b"
        }
      },
      "language_models": {
        "lmstudio": {
          "api_url": "http://192.168.1.100:1234/api/v0"
        }
      },
      "ui_font_size": 16,
      "buffer_font_size": 15,
      "theme": {
        "mode": "system",
        "light": "Ayu Light",
        "dark": "Ayu Dark"
      }
    }

    请注意以下关键配置项:

    • provider: 确保设置为 “lmstudio”,以便 Zed 识别此服务提供商。
    • model: 这里需要填入您在 LM Studio 中加载的模型标识,例如 “openai/gpt-oss-20b”。
    • api_url: 填写 LM Studio API 服务的完整访问地址。

    3. 验证效果

    完成配置后,重新启动 Zed。
    打开 Inline Assist 功能,输入测试代码或指令,如果能得到 AI 输出,即表示配置成功。