
过去半年,我花了不少业余时间搭建属于自己的本地 AI 环境。从最开始只会使用 ChatGPT 网页版,到后来在 Windows 上部署 Ollama、配置 OneAPI 统一管理模型接口、搭建 Open WebUI,再到调试 Claude Code CLI、Codex CLI、Qwen CLI,最终形成了一套稳定的 AI 工作流。现在,一张 NVIDIA RTX 4090 24GB 显卡已经能够稳定运行 Qwen3-30B-A3B(以及不同量化版本的 27B/32B 级模型),承担日常代码分析、数据处理、文档生成等任务,而 Claude Code CLI 则负责复杂的软件开发和代码重构,两者配合之后,几乎成为了我每天工作的 AI 助手。这篇文章记录整个过程,希望能够给同样准备搭建本地 AI 环境的朋友提供一些参考。
为什么选择本地部署?
最开始,我和很多人一样,主要依赖网页版 AI 工具。
虽然方便,但随着使用越来越深入,我逐渐遇到了几个问题:
公司内部代码无法上传到公网;
数据分析涉及业务数据,不适合交给第三方平台;
API 成本随着调用次数不断增加;
网络环境偶尔不稳定;
不同模型切换非常麻烦。
于是,我开始思考:能不能搭建一套完全属于自己的 AI 工作环境?
答案是可以。
第一阶段:Windows 部署 Ollama
我的整个 AI 环境,是从 Ollama 开始的。
原因很简单。
它几乎是目前 Windows 平台部署本地大模型最简单的方案。
安装完成之后,只需要执行:
ollama run qwen3
模型便开始自动下载。
第一次看到几十 GB 的模型缓慢下载时,其实还是有些激动。
因为这意味着,以后很多 AI 工作都可以完全脱离云端。
随后,我陆续部署了几个模型。
例如:
Qwen3
DeepSeek-R1
Gemma
Llama 3
Mistral
不同模型各有特点。
写代码,我更倾向 Claude 或 DeepSeek。
数据分析,则更喜欢 Qwen。
一些简单聊天,本地模型已经完全足够。
第二阶段:OneAPI 统一管理所有模型
随着模型越来越多,一个新的问题出现了。
不同模型对应不同接口。
有的是 Ollama。
有的是 OpenAI API。
有的是 Claude API。
还有 Azure OpenAI。
每次切换 Base URL,都非常麻烦。
后来发现了 OneAPI。
它几乎成为整个 AI 系统最重要的一环。
部署之后,我开始统一管理:
localhost:3000
所有模型。
包括:
OpenAI
Claude
Gemini
Ollama
DeepSeek
Qwen
全部统一成 OpenAI API 格式。
最大的好处就是:
以后所有客户端,都不用关心模型来自哪里。
只需要:
Base URL
API Key
Model Name
即可调用。
这也是后来 Claude Code CLI、Open WebUI 能够无缝切换模型的重要原因。
第三阶段:Open WebUI
如果说 Ollama 提供模型。
那么 Open WebUI 就提供了一个真正好用的界面。
部署完成之后,我几乎不用再打开 Ollama 命令行。
整个页面非常接近 ChatGPT。
支持:
多轮对话
文件上传
RAG
Markdown
图片识别
多模型切换
多用户管理
尤其连接 OneAPI 后。
所有模型都会自动显示。
可以一键切换:
上午分析 Excel。
下午写 SQL。
晚上继续总结会议纪要。
整个体验已经非常接近商业 AI 产品。
第四阶段:CLI 才是真正提升效率的开始
真正让我效率提升最大的,并不是 WebUI。
而是 CLI。
以前修改代码:
打开 IDE。
复制代码。
打开网页。
粘贴。
等待回复。
现在几乎全部发生在终端。
Claude Code CLI
不得不承认。
Claude Code 给我的震撼最大。
尤其在大型项目。
它不仅仅回答问题。
而是真正参与开发。
例如:
分析整个 React Native 项目
它会自动:
读取目录。
分析依赖。
定位 Bug。
修改代码。
生成 Commit。
甚至还能解释为什么这样修改。
很多时候,我更像是在和一位高级开发工程师一起工作。
而不是一个聊天机器人。
现在我的很多:
React Native
Spring Boot
Node.js
Python
项目。
基本都会先让 Claude Code 做第一轮分析。
效率提升非常明显。
Codex CLI
Codex 更适合:
快速生成脚本。
修改配置。
编写自动化工具。
例如:
批量处理日志。
生成 Python 数据分析脚本。
Shell 自动部署。
这些任务完成速度非常快。
虽然复杂推理能力没有 Claude 强。
但是执行效率很高。
Qwen CLI
Qwen CLI 更多承担:
本地推理。
离线分析。
中文总结。
知识问答。
最大的优势就是:
完全离线。
公司内部资料。
ERP 数据。
MES 数据。
全部可以本地分析。
没有任何数据上传。
对于制造企业来说,这一点非常重要。
RTX 4090 真正能够做到什么?
我的硬件:
CPU:
Intel i9
GPU:
RTX 4090 24GB
内存:
128GB DDR5
很多人问:
4090 能跑多大的模型?
我的实际体验:
Qwen3 的 27B(不同量化版本)已经能够流畅运行,日常对话、代码分析、文档总结都没有明显压力;如果使用更高精度版本,则需要根据量化方式和上下文长度权衡显存占用。
在数据分析场景:
例如:
上传:
Excel。
CSV。
SQL 查询结果。
几十万行数据。
让模型:
统计。
分类。
总结。
生成报告。
速度已经能够满足日常办公。
当然。
如果需要:
70B。
120B。
甚至更大的模型。
还是需要多卡或者云端。
但对于个人办公来说。
4090 已经是一张性价比非常高的 AI 显卡。
AI 已经成为我的办公助手
现在。
AI 已经不是偶尔使用。
而是每天都在使用。
例如:
上午。
收到十几封英文邮件。
Claude:
先总结。
再翻译。
最后帮我生成回复。
整个过程不到一分钟。
下午。
生产部门发来:
Excel。
几十万条数据。
Qwen:
自动统计。
生成图表建议。
分析异常数据。
晚上。
需要准备 PPT。
AI:
整理结构。
生成大纲。
润色内容。
甚至给出配图建议。
包括:
Word。
Excel。
PowerPoint。
Markdown。
PDF。
几乎全部可以完成。
很多以前需要半天完成的工作。
现在几十分钟就能完成。
我踩过的一些坑
整个搭建过程,并没有想象中顺利。
印象最深的几个问题:
第一,CUDA 版本。
很多模型无法启动,并不是模型问题。
而是 CUDA 与驱动版本不一致。
更新驱动之后,一切恢复正常。
第二,显存不是唯一瓶颈。
很多人只关注 GPU。
实际上:
CPU。
内存。
SSD。
同样重要。
尤其 Windows。
如果内存不足。
模型加载速度会明显下降。
第三,不同模型适合不同任务。
一开始,我希望一个模型解决所有问题。
后来发现这是不现实的。
代码。
Claude 更强。
中文总结。
Qwen 更自然。
数学推理。
DeepSeek 表现不错。
真正高效的方式,不是寻找"最强模型",而是根据任务选择最合适的模型。
第四,统一 API 非常重要。
如果没有 OneAPI。
每个客户端都要配置不同接口。
维护成本越来越高。
统一之后。
所有工具:
Claude Code。
Continue。
Open WebUI。
Cherry Studio。
IDE 插件。
全部共享一个接口。
整个维护工作简单了很多。
写在最后
回头看,这套 AI 环境真正改变我的,并不是拥有了一块性能很强的显卡,也不是成功部署了多少个模型,而是改变了我的工作方式。
现在,我已经很少把 AI 当成一个简单的问答工具,而是把它看作团队里的"第二大脑"。它负责整理信息、分析数据、生成文档、协助开发、检查代码、润色邮件,也帮助我快速理解新的技术框架和业务需求。很多重复性的工作都可以交给 AI,而我可以把更多精力放在架构设计、项目推进和跨部门沟通上。
未来,大模型的发展一定还会继续加速,模型会越来越强,部署门槛也会越来越低。但无论技术如何变化,我认为真正重要的并不是追逐最新的模型,而是建立一套适合自己的 AI 工作流,让 AI 真正融入每天的工作,而不是停留在"体验新技术"的阶段。
对我来说,这套本地 AI 环境已经不只是一个技术项目,更像是一位全天在线、能够持续协作的智能工作伙伴。它没有取代我的工作,却让我有更多时间去思考那些真正需要人来完成的事情——决策、沟通、创造和成长。
评论 (1)
写的不错,谢谢大佬分享