AI 工具
本地优先 · 开源免费 · 数据不上传,全部为可在自有设备(CPU/GPU)运行的开源方案
下方磁贴按「工具 / 教程」依次排列,点任意磁贴展开详情 ↓
🧹 在线去水印
适合「AI生成」等右下角角标、纯色背景小字水印。图像处理全程在浏览器本地完成,图片与遮罩不上传任何服务器;复杂背景建议用 IOPaint(Sanster/IOPaint,MIT)本地部署方案。
🤖 Qwen3.8-27B · 本地部署教程
阿里通义实验室 2026-08-14 开源的 27.8B 稠密多模态 大模型(文本 / 图像 / 视频输入),Apache 2.0 可商用;原生 256K 上下文(YaRN 外推至 1M),混合注意力(48 层 Gated DeltaNet 线性注意力 + 16 层 Gated Full Attention),单卡 24G 显存即可本地运行,被社区视为「尺寸刚好、量化后消费显卡能跑」的旗舰级开源模型。
- · GitHub 源码:QwenLM/Qwen3.8
- · HuggingFace 权重:Qwen/Qwen3.8-27B
- · 许可:Apache 2.0(可免费商用)
- · 最低:Q4_K_M GGUF ≈ 24GB 显存(RTX 4090 / 5080 / M3 Max)
- · 推荐:32–48GB(Q5_K / Q6_K),吞吐更高
- · BF16 全精度约 55.6GB(多卡 / 服务器)
# SGLang(推荐,--tp-size 按卡数;消费级单卡可用 llama.cpp / Ollama 加载 GGUF)
sglang serve --model-path Qwen/Qwen3.8-27B --port 8000 --tp-size 4 --context-length 262144 --reasoning-parser qwen3
# vLLM
vllm serve Qwen/Qwen3.8-27B --port 8000 --tensor-parallel-size 4 --max-model-len 262144 --reasoning-parser qwen3
# 消费级显卡(单卡 24G):加载 GGUF 量化版,文件名以 HuggingFace / ModelScope 仓库为准
# llama.cpp: ./llama-server -m Qwen3.8-27B-Q4_K_M.gguf
# Ollama: ollama run qwen3.8:27b
from openai import OpenAI
c = OpenAI(base_url="http://localhost:8000/v1", api_key="EMPTY")
r = c.chat.completions.create(
model="Qwen/Qwen3.8-27B",
messages=[{"role": "user", "content": "用一句话解释混合注意力架构"}],
)
print(r.choices[0].message.content)
提示:思考模式默认开启,可按请求关闭;多模态输入(图 / 视频)通过 messages 的 image_url / 视频字段传入。基准参考:Terminal-Bench 2.1 73.0、SWE-bench Pro 61.7、OSWorld-Verified 84.3(来自官方模型卡)。
🦙 Ollama · 本地大模型运行框架
一行命令在本地跑开源大模型,自动管理权重与推理;macOS / Linux / Windows 全平台,自带 OpenAI 兼容 API(localhost:11434),是本地体验大模型最省心的入口。
- · GitHub:ollama/ollama(MIT)
- · 官网与安装包:ollama.com
- · 7B(Q4)≈ 4–6GB 显存 / 内存
- · 14B(Q4)≈ 8–12GB;32B 需 20GB+
- · 无独显:走 CPU 推理(更慢)
# Linux / macOS 一键安装
curl -fsSL https://ollama.com/install.sh | sh
# 拉取并运行一个模型(首次自动下载权重)
ollama run qwen2.5:7b
ollama run llama3.8:8b # 具体标签以官方库为准
# 查看本机模型 / 启动 API 服务
ollama list
ollama serve # OpenAI 兼容 API → http://localhost:11434
提示:Ollama 底层即 llama.cpp(见下一张),把模型管理与推理封装成最省心的体验;想自定义量化 / 参数再往下看。
⚙️ llama.cpp · LLM 推理引擎(C/C++)
纯 C/C++ 的 LLM 推理引擎,GGUF 量化格式的发源地;CPU / CUDA / Metal / Vulkan 全支持,树莓派到服务器都能跑,是几乎所有本地方案(含 Ollama)的底层根引擎。
- · GitHub:ggml-org/llama.cpp(MIT)
- · 文档与示例见仓库 README
- · 极致轻量,纯 CPU 也能跑
- · GGUF Q4 7B ≈ 4GB;可 GPU 卸载加速
- · 量化越狠越省显存,精度略降
# 克隆并编译
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp && cmake -B build && cmake --build build --config Release
# 启动本地 OpenAI 兼容服务
./build/bin/llama-server -m model.Q4_K_M.gguf --port 8080
# Python 绑定(可选)
pip install llama-cpp-python
提示:想最快上手用 Ollama;想玩量化 / 服务端 / 嵌入式部署直接用它,控制力最强。
🎨 ComfyUI · 本地 AI 绘画工作流
节点式 Stable Diffusion / Flux 可视工作流,局部重绘、ControlNet、LoRA、动画全可控,适合想精确控制出图的人。
- · GitHub:comfyanonymous/ComfyUI
- · 模型权重(safetensors / gguf)自管
- · 6GB 可跑 SD1.5
- · 12GB+ 跑 SDXL / Flux 更顺
- · 支持 CUDA / ROCm
# 克隆并安装依赖(或下载官方便携包)
git clone https://github.com/comfyanonymous/ComfyUI
cd ComfyUI && pip install -r requirements.txt
# 启动,浏览器开 http://127.0.0.1:8188
python main.py
提示:权重放 models/ 目录;社区自定义节点生态极大,ControlNet / AnimateDiff 等都能接。
🎙️ Whisper · 本地语音转文字
OpenAI 开源的离线语音识别,99 种语言,完全本地运行,适合字幕、会议记录、采访整理。
- · GitHub:openai/whisper(MIT)
- · 需先装 ffmpeg
- · base ≈ 1GB;large-v3 需 10GB+
- · CPU 可跑(较慢);GPU 加速明显
# 安装(ffmpeg 必装,Windows 可用 winget / choco)
pip install -U openai-whisper
winget install ffmpeg
# 转写(中文加 --language zh 更准)
whisper audio.mp3 --model base --language zh
whisper meeting.m4a --model medium -o subs/ # 输出 srt / vtt
提示:长音频建议 large 或 WhisperX(带逐字时间戳对齐);纯离线,无需联网。
✨ Fooocus · 一键出图
把 Stable Diffusion 包装成「极简出图」体验:参数全隐藏、质量内卷,本地一键生图,适合不想调参的人。
- · GitHub:lllyasviel/Fooocus
- · SDXL 基底
- · 6–8GB 流畅出图
- · 显存越大出图越快
git clone https://github.com/lllyasviel/Fooocus
cd Fooocus && pip install -r requirements_versions.txt
# 启动,浏览器开 http://127.0.0.1:7865
python launch.py
提示:风格 / 画质由内建预设决定;想进阶控制再上 ComfyUI。
💬 text-generation-webui
本地大模型的「WebUI 瑞士军刀」:多后端(llama.cpp / ExLlama / Transformers)、聊天、角色扮演、微调一体化。
- · GitHub:oobabooga/text-generation-webui
- · 社区插件 / 角色卡丰富
- · 依模型,7B Q4 ≈ 4–6GB
- · llama.cpp 后端最省显存
# Linux
bash <(curl -sL https://raw.githubusercontent.com/oobabooga/text-generation-webui/main/start_linux.sh)
# Windows:下载仓库后运行 start_windows.bat
# 启动后浏览器开 http://127.0.0.1:7860
# 在界面加载 GGUF / safetensors 权重即可对话
提示:显存紧就开 --load-in-8bit / 选用 llama.cpp(GGUF)后端;角色扮演可导入社区角色卡。
关于本地算力
- · 本站不托管任何模型权重,请按各卡片官方仓库自行下载;去水印等重计算工具建议在带独显的主机上部署体验更佳。
- · 在线去水印基于 IOPaint 思路的纯前端 Telea 修复实现(Sanster/IOPaint,MIT),图像处理全程在浏览器本地完成。
- · 其余均为开源本地推理 / 生成项目,链接见各卡片;数据不出本机。