大模型-新手安装Ollama以及大模型调用

电脑配置

配置项最低配置推荐配置(个人笔记本)生产配置
💻 CPU4 核8 核16 核+
🧠 RAM8GB16GB32GB+
🎮 GPU❌ 不需要⚡ 可选 (加速推理)🚀 NVIDIA A100
💾 磁盘10GB50GB200GB+
🕒 响应速度5-10秒1-3秒< 1秒

这里我用的是个人笔记本配置

下载安装Ollama

在官网选择对应的版本下载
https://ollama.com/download

OllamaSetup.exe

Windows直接双击启动时,它默认安装C盘,无法界面选择。当我需要装到D盘时使用如下命令,在下载路径中打开CMD

 .\OllamaSetup.exe  /DIR="D:\Ollama"

可以看到它的安装日志已经显示是D盘了
在这里插入图片描述

直到下图说明安装完成
在这里插入图片描述

CMD命令行验证安装完成,版本号如下

ollama --version
ollama version is 0.32.1

更改模型存放地址

默认它会存放在
Linux/macOS系统
默认路径通常为 ~/.ollama/models (用户主目录下的隐藏文件夹)。

  • 验证方法:终端执行 ls -la ~/.ollama/models ,若存在则显示模型文件列表。

Windows系统
默认路径为 %APPDATA%\Ollama\models (如 C:\Users<用户名>.ollama\models )。
◦ 验证方法:Win+R输入 %APPDATA% ,导航至 Ollama\models 文件夹。

在这里插入图片描述

使用ollama 下载 LLM 和 Embedding 模型

常见大模型特点

模型大小特点推荐用途
llama3.21B / 3BMeta 出品,轻量快速英文日常对话、简单问答,大小4GB
qwen3.50.8B/2B/4B/9B/35B/122B阿里出品,中文能力强,Instruct集成版性能要求低中文写作、代码生成
deepseek-r11.5B / 7B / 14B / 32B推理能力突出逻辑推理、数学计算
mistral7B欧洲开源,英文强英文写作、翻译

qwen3.5:2b-q4_k_m这里是2B量化压缩版本,普通16G笔记本可以使用,磁盘空间占用1.6G;4b版本需要磁盘空间3.2G集显运行时间大约45秒一个简短思考。

这里使用最小版本下载,毕竟笔记本的性能有限,如果你的电脑配置高可以选择更好的模型下载

# 1. 下载对话模型(Llama 3.1 8B,约 4.7GB)
ollama pull llama3.1:8b

# 2. 下载 Embedding 模型(用于向量化文本)
ollama pull nomic-embed-text

# 验证模型
ollama list
# 应显示:
# NAME              SIZE   MODIFIED
# llama3.1:8b      4.7 GB  ...
# nomic-embed-text  274 MB  ...

国内下载速度还是挺快的
在这里插入图片描述

在这里插入图片描述

如上图说明下载完成

查看已经安装的模型

 ollama list
NAME                       ID              SIZE      MODIFIED
llama3.1:8b                46e0c10c039e    4.9 GB    15 hours ago
nomic-embed-text:latest    0a109f422b47    274 MB    15 hours ago

启动模型并使用模型对话

llama run llama3.1
pulling manifest
pulling 667b0c1932bc: 100% ▕███████████████████████████████████████████████████████████████████████▏ 4.9 GB
pulling 948af2743fc7: 100% ▕███████████████████████████████████████████████████████████████████████▏ 1.5 KB
pulling 0ba8f0e314b4: 100% ▕███████████████████████████████████████████████████████████████████████▏  12 KB
pulling 56bb8bd477a5: 100% ▕███████████████████████████████████████████████████████████████████████▏   96 B
pulling 455f34728c9b: 100% ▕███████████████████████████████████████████████████████████████████████▏  487 B
verifying sha256 digest
writing manifest
success
>>> hello
Hello! How are you today? Is there something I can help you with or would you like to chat?

>>> 你好
You're speaking Chinese! (I think) Hello, nǐ hǎo!

API 调用

使用Ollama 的http服务接口调用

Ollama 启动后会自动在本地运行一个 API 服务,地址是 http://localhost:11434。这意味着你可以通过 HTTP 请求调用模型,就像使用 OpenAI API 一样

curl http://localhost:11434/api/generate -d '{
  "model": "qwen2.5:7b",
  "prompt": "什么是 Transformer?用一句话解释。",
  "stream": false
}'

也可以在postman中直接测试
在这里插入图片描述

在代码中调用

方式1:通过 Python 调用http接口
import requests

url = "http://localhost:11434/api/generate"
payload = {
    "model": "qwen2.5:7b",
    "prompt": "用 Python 写一个计算 Fibonacci 数列的函数",
    "stream": False
}

response = requests.post(url, json=payload)
print(response.json()["response"])

本地使用比较直接,无token限制

方式2:直接引入ollama Python 包(推荐)调用
##下载ollma包
pip install ollama



import ollama

# 简单对话
response = ollama.chat(
    model="qwen2.5:7b",
    messages=[
        {"role": "system", "content": "你是一个专业的程序员"},
        {"role": "user", "content": "用 Python 实现一个快速排序算法"}
    ]
)

print(response["message"]["content"])

项目内部提供模块化服务使用,无token限制,token检查有专门的模块服务负责

方式3:自定义API调用,这里使用FastApi自定义http服务接口
from fastapi import FastAPI
import ollama

app = FastAPI()

@app.post("/chat")
def chat(prompt: str):
    response = ollama.chat(
        model="qwen2.5:7b",
        messages=[{"role": "user", "content": prompt}]
    )
    return {"answer": response["message"]["content"]}

一般项目服务产品,或者给第三方提供服务SAAS采用此种方式,可以在每次调用前校验用户权限,用户的token余额是否足够

如果只是简单使用这里已经全部完成了,无非就是根据你的电脑配置,你可以使用更大更新更快的模型而已。

下面的章节为开发做准备,如果你要研究RAG等可能需要开发环境和依赖包

拓展-Ollama 配置文件Modelfile

Modelfile 是 Ollama 用来定义和构建自定义模型的配置文件,类似于 Dockerfile。你可以通过它:

  • 基于已有模型创建新模型
  • 修改系统提示(System Prompt)
  • 调整推理参数
  • 自定义输入输出格式
  • 加载微调适配器(LoRA)
  • 预设对话历史
  • 打包成可分享的模型镜像

Ollama 超详细配置教程之Modelfile

https://blog.csdn.net/weixin_74256690/article/details/151353588

python3安装环境依赖[为下一篇RAG开发做准备]

具体安装方式参考我之前的blog
https://blog.csdn.net/zjcjava/article/details/100751958

安装完成cmd查看当前版本如下

>python
Python 3.13.7 (tags/v3.13.7:bcee1c3, Aug 14 2025, 14:15:11) [MSC v.1944 64 bit (AMD64)] on win32
Type "help", "copyright", "credits" or "license" for more information.

依赖包说明如下

包名用途是否必需
langchainRAG编排框架核心必需
langchain-ollamaOllama集成(LLM+Embeddings)必需
chromadb本地向量数据库;必需
pypdfPDF文档解析按需
python-docxWord 文档解析按需
streamlitWeb UI框架可选
tiktokenToken计数(分块优化)推荐

安装命令如下(根据系统命令不同替换不同的换行符)

# 创建虚拟环境(推荐)
python -m venv rag-env
rag-env\Scripts\activate  # Windows
# source rag-env/bin/activate  # macOS/Linux
# rag-env\Scripts\activate  # Windows

# 安装依赖 windows下 powershell
pip install -U pip
pip install `
  langchain>=0.3.0 `
  langchain-ollama>=0.2.0 `
  langchain-community>=0.3.0 `
  chromadb>=0.5.0 `
  sentence-transformers>=3.0.0 `
  pypdf>=1.13.0 `
  python-docx>=1.1.0 `
  streamlit>=1.39.0 `
  tiktoken>=0.8.0 `
  rank-bm25>=0.2.2 `
  --index-url https://pypi.tuna.tsinghua.edu.cn/simple

##pip 如果是mac,centos则`替换为\
# CMD则`替换为^



评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值