专辑封面

加载中...

80%
llama.cpp部署及VS Code插件Continue连接
本文最后更新于 102 天前,其中的信息可能已经有所发展或是发生改变,如有错误请发送邮件到 ZChaohaoZhang@hotmail.com

开篇呢,先给自己叠个甲,博主也是花了些时间才完成,所以别嫌博主啰嗦,我认为啰嗦才是一个人单独完成该部署的独有留白。如有不适,请立即离开,以防生气。博主一方面也是为自己谋个后路,另一方面希望能够帮助到想要得到帮助的人。

一:

首先呢,要确认适合您的模型大小,例如我的笔记本配置:

,适合7B-9B,模型可完全加载至显存,响应如飞,体验流畅,然后呢去官方文档内阅览相关文件和要求内容:( https://github.com/ggml-org/llama.cpp ),要是嫌麻烦呐,悄悄告诉您,访问(https://zread.ai/ggml-org/llama.cpp),去拆解文档内容。

二:

动动发财的小手,嘿,点击图片中的位置:

,您就得到了文件的上传历史记录了。

,(对于llama.cpp,应该优先选择带有“GGUF”字样的量化模型文件,其中GGUF 是 llama 项目专门定义的一种模型文件格式,它把模型结构和量化后的数据打包在一起,能让 llama直接、高效地加载运行。)好,下载好版本,建议是在迅雷上下载,因为这样相对来说快一点。(ps:博主使用的是校园网,所以下载慢,才采用了迅雷下载,一旦迅雷没有周围资源的话,就无法下载,所以一切看环境)

三:

下载后,再来下载本地的模型:(https://hf-mirror.com/models),挑选你所适配的大模型。

,在文件列表中找到 Qwen3.5-9B-UD-Q4_K_XL.gguf,点击下载。(图片作为参考)。

四:

您打开的这个文件夹 (cudert-llama-bin-win-cuda-12.4-x64) 只有三个 .dll 文件,它们是连接 llama和你的 NVIDIA 显卡进行加速的桥梁。(这里博主也是犯了难,没有.exe这怎么打开呢,但是这三个文件可事关重要!),相应的文件在这:(https://github.com/ggml-org/llama.cpp/releases/download/b8840/llama-b8840-bin-win-cuda-12.4-x64.zip)。下载安装后建议将地址放在熟悉的位置,以免忘记地址。

五:找寻到该地址后,先将三个.dll放入在llama.cpp文件内,直接剪切粘贴就行,然后打开该文件的cmd窗口,如果这个不知道怎么操作的话,你该好好的学习了!

,点击箭头所指位置,输入cmd,

 .\llama-cli.exe -m "E:\Models\Qwen3.5-9B-UD-Q4_K_XL.gguf" -ngl 999 --color auto

(这里的文件位置自己设置,别老实巴交的全按照我的路径来了。还有路径一定要全英文路径,不然会爆错!:
(eg:

E:\llama-b8840-bin-win-cuda-12.4-x64>.\llama-cli.exe -m “D:\迅雷下载\Qwen3.5-9B-UD-Q4_K_XL.gguf” -ngl 999 –color auto
load_backend: loaded RPC backend from E:\llama-b8840-bin-win-cuda-12.4-x64\ggml-rpc.dll
load_backend: loaded CPU backend from E:\llama-b8840-bin-win-cuda-12.4-x64\ggml-cpu-alderlake.dll

Loading model… |gguf_init_from_file: failed to open GGUF file ‘D:\Ѹ������\Qwen3.5-9B-UD-Q4_K_XL.gguf’ (No such file or directory)
llama_model_load: error loading model: llama_model_loader: failed to load model from D:\Ѹ������\Qwen3.5-9B-UD-Q4_K_XL.gguf
llama_model_load_from_file_impl: failed to load model
llama_params_fit: encountered an error while trying to fit params to free device memory: failed to load model llama_model_load: error loading model: llama_model_loader: failed to load model from D:\Ѹ������\Qwen3.5-9B-UD-Q4_K_XL.gguf
llama_model_load_from_file_impl: failed to load model
common_init_from_params: failed to load model ‘D:\Ѹ������\Qwen3.5-9B-UD-Q4_K_XL.gguf’
srv load_model: failed to load model, ‘D:\Ѹ������\Qwen3.5-9B-UD-Q4_K_XL.gguf’

Failed to load the model) )

六:
如果出现以上内容,说明您已经安装成功了,并且可以使用了。

七:

这里来解释命令行窗口(CLI)中的含义:

 .\llama-server.exe -m "E:\Models\Qwen3.5-9B-UD-Q4_K_XL.gguf" -ngl 999 -c 4096 -fa on -ctk q8_0 -ctv q8_0 -t 4 --host 0.0.0.0 --port 8080

-m : 模型路径 | 我的值:"E:\Models\Qwen3.5-9B-UD-Q4_K_XL.gguf"
-ngl :加载到GPU的层数 | 999 :(将所有的层数加载到RTX 4060显存)
-c : 上下文长度(最大支持的token数)| 4096 (可处理约3000汉字的对话历史)  ps:这里应该设再大一点,不然不够用会导致对话卡壳
-fa on :启用Flash Attention,节约显存并增加推理 | on
-ctk q8_0 : 将KV缓存中的Key矩阵量化为8-bit,减少显存占用 | q8_0
-ctv q8_0 : 将KV缓存中的Value矩阵量化为8-bit | q8_0
-t : CPU线程数 | 4 (避免线程过多导致调度拥堵)
--host : 服务器监听的IP地址 | 0.0.0.0 (允许任何设备访问本机API)
--port : 服务器监听的端口号 | 8080 (可通过http://localhost:8080访问)

–host 0.0.0.0 和 –port 8080 的作用:

  • –host 0.0.0.0 :让 API 服务监听本机所有网络接口。这意味着:
    • 本机程序可以通过 127.0.0.1.8080或 localhost:8080访问。
    • 同一局域网内的其他设备(如手机、平板、另一台电脑)也可以输入你电脑的局域网 IP(例如 192.168.1.5:8080)来调用模型(需关闭防火墙或放行端口)。–
  • –port 8080 :指定 API 服务使用的端口号。你可以改成任意未占用的端口(如11434、5000 等)。

八:

如果您需要和VS Code配合使用的话,还请您再往下瞧:

安装 Continue 插件:

之后呢寻找该文件的位置:一般在 C:\Users\admin\.continue 内,目前我使用的是json文件,据说这个json文件将会被代替。

{

  “$schema”: “https://schema.continue.dev/config.json”,

  “name”: “continue-config”,

  “version”: “1”,

  “models”: [

    {

      “title”: “Qwen3.5-9B Local”,

      “provider”: “openai”,

      “model”: “AUTODETECT”,

      “apiBase”: “http://localhost:8080/v1”,

      “apiKey”: “EMPTY”,

      “roles”: [“chat”, “edit”, “apply”],

      “noProxy”: true,

      “timeout”: 60000

    }

  ]

}

修改后文件保存,然后重新打开VS Code 即可
回顾整个过程,您从一个对 llama.cpp 完全陌生的起点,一步步解决了文件下载、CUDA 环境配置、命令行参数优化、API 服务搭建,最后成功集成到 IDE。这种从底层编译到上层应用的全链路实践,是非常宝贵的经验。您的设备和这台本地 AI 环境,将成为你学习、科研和项目开发的得力工具。

文末附加内容
暂无评论

发送评论 编辑评论


				
|´・ω・)ノ
ヾ(≧∇≦*)ゝ
(☆ω☆)
(╯‵□′)╯︵┴─┴
 ̄﹃ ̄
(/ω\)
∠( ᐛ 」∠)_
(๑•̀ㅁ•́ฅ)
→_→
୧(๑•̀⌄•́๑)૭
٩(ˊᗜˋ*)و
(ノ°ο°)ノ
(´இ皿இ`)
⌇●﹏●⌇
(ฅ´ω`ฅ)
(╯°A°)╯︵○○○
φ( ̄∇ ̄o)
ヾ(´・ ・`。)ノ"
( ง ᵒ̌皿ᵒ̌)ง⁼³₌₃
(ó﹏ò。)
Σ(っ °Д °;)っ
( ,,´・ω・)ノ"(´っω・`。)
╮(╯▽╰)╭
o(*////▽////*)q
>﹏<
( ๑´•ω•) "(ㆆᴗㆆ)
😂
😀
😅
😊
🙂
🙃
😌
😍
😘
😜
😝
😏
😒
🙄
😳
😡
😔
😫
😱
😭
💩
👻
🙌
🖕
👍
👫
👬
👭
🌚
🌝
🙈
💊
😶
🙏
🍦
🍉
😣
Source: github.com/k4yt3x/flowerhd
颜文字
Emoji
小恐龙
花!
上一篇
下一篇