LocalAI 本地推理服务器:一行 Docker 命令跑通,免 GPU 也能对话 LLM LocalAI 本地推理服务器一行 Docker 命令跑通免 GPU 也能对话 LLM【免费下载链接】LocalAILocalAI is the open-source AI engine. Run any model - LLMs, vision, voice, image, video - on any hardware. No GPU required.项目地址: https://gitcode.com/GitHub_Trending/lo/LocalAI模型放云端数据出不了内网想先试模型又不想先买显卡。LocalAI 本地推理服务器把 LLM、图像、语音模型装进自己的机器接口兼容 OpenAIDocker 一条命令就能跑不需要 GPU。 先判断走哪条路再动手当前情况推荐路径最短命令机器有 Docker要最少步骤官方容器镜像docker run -ti --name local-ai -p 8080:8080 localai/localai:latest没有 Docker想装进系统里官方安装脚本从官网取install.sh执行要改源码、写自己的后端源码构建git clone https://gitcode.com/GitHub_Trending/lo/LocalAI后make build三条路里推荐容器镜像按需拉取模型要用哪个后端才拉哪个后端装好的 CPU 镜像是最小体积后续加 GPU 后端不用重装。 容器路径三条命令内跑通docker run -ti --name local-ai -p 8080:8080 localai/localai:latest docker exec -it local-ai local-ai run qwen3-4b curl http://localhost:8080/readyz第一条起容器第二条装小模型qwen3-4bCPU 可载支持函数调用第三条打健康检查返回ok即服务就绪。接着浏览器打开http://localhost:8080LocalAI 本地推理 WebUI 首页会列出已加载模型与系统资源状态能正常渲染就完全跑通。有 NVIDIA 显卡的话把镜像换成localai/localai:latest-gpu-nvidia-cuda-12命令里追加--gpus all即可。 跑通之后最容易卡住的三个点curl提示 connection refused容器其实没起来先docker logs local-ai看启动报错。8080 端口被占宿主机已有服务占用映射改成-p 9090:8080只动这一个参数。模型能载但推理极慢甚至被杀内存偏小换更小的量化档如llama-3.2-1b-instruct:q4_k_m可选清单看 gallery。 最小可用场景发出第一次对话模型加载后直接用 OpenAI 兼容接口发一条请求curl http://localhost:8080/v1/chat/completions \ -H Content-Type: application/json \ -d {model:qwen3-4b,messages:[{role:user,content:你好}]}返回里出现choices和回复内容说明这个端点已经能当 OpenAI 接口用把现有代码里的base_url指到http://localhost:8080/v1其余代码不用改。✅ 下一步动作多装模型就翻 模型配置示例更多对话格式看 prompt-templates/想开多用户与 API key 权限启动时加环境变量LOCALAI_AUTHtrue单机不够用时去 core/p2p/ 看 P2P 分布式实现。【免费下载链接】LocalAILocalAI is the open-source AI engine. Run any model - LLMs, vision, voice, image, video - on any hardware. No GPU required.项目地址: https://gitcode.com/GitHub_Trending/lo/LocalAI创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考