news 2026/8/24 13:46:34

2026/08/16 AI学习笔记

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
2026/08/16 AI学习笔记

一 . Ollama学习笔记

1. ollama概述

Ollama 可以理解成“本地版的 OpenAI API”,可以直接调用,不需要通过互联网。

没有部署的:

你的电脑


Spring AI


互联网


DeepSeek / OpenAI / 豆包


返回结果

部署ollama的:

你的电脑


Spring AI


Ollama


Qwen3 8B


返回结果

2. ollama的优势

1. 模型切换方便

想测试:

Qwen3
DeepSeek
Llama
Gemma
Mistral

直接下面命令下载:

ollama pull qwen3:8b

ollama pull gemma3:4b

ollama list进行查看:

想使用哪个,可以直接运行:

ollama run qwen3:8b

ollama run gemma3:4b

ollama run qwen3:8b --think=false(关闭思考模式)

2. ollama不是运行器

AI应用


Spring AI


┌───────────┐
│ Ollama │ ← 运行器/API
└───── ┬─────┘

┌─────── ┴────────┐
▼ ▼
Qwen3 8B Embedding模型


GPU / CPU

ollama不是大模型,它是一个负责运行大模型的软件。

3. 后续学习路线

spring ai和ollama本地大模型进行交互

3. CPU,GPU,Ollama,大模型之间的关联

1. 本机电脑说明

例如下面电脑的配置:

CPU:i7-8750H
RAM:16GB
GPU:GTX 1060 6GB

运行:

Ollama

Qwen3 8B

实际上是CPU + RAM + GPU + 显存一起协作,只是各自负责的工作不一样。

RAM 是“仓库”,显存是“GPU旁边的小仓库”,CPU/GPU 是“工人”。

2. Ollama 为什么会消耗 GPU?

因为Ollama是模型运行器,真正工作的是CPU/GPU。

真正消耗GPU的是:Qwen3 模型的神经网络计算。

Ollama 只是负责把这些计算任务安排给 CPU/GPU。

3. 为什么大模型特别喜欢 GPU

因为大模型最核心的工作,本质上是:

大量矩阵运算。

比如神经网络里面会出现大量:

矩阵 × 矩阵
矩阵 × 向量

假设有:

A = 1000 × 1000
B = 1000 × 1000

计算:

A × B

需要做非常多的乘法和加法。

cpu也可以算。

但是 CPU 更擅长:

少量、复杂、串行

而 GPU 非常擅长:

大量、简单、并行

所以:

CPU:
一个工人
一个一个处理

GPU:
几千个小工人
同时处理

这就是为什么大模型推理非常适合 GPU。

4. RAM 和显存有什么区别

RAM:

容量比较大,CPU使用。

VRAM:

GPU自己的高速内存,GPU使用。

5. ollama启动时候,模型是如何进行加载的

启动:

ollama run qwen3:8b

发生:

流程:

第一步: 模型放在E盘

第二步: Ollama运行模型

E盘

RAM

把模型加载到内存。

第二步: 如果 GPU 可用

RAM

VRAM

把一部分模型放到显存。

第四步:GPU开始计算:

GPU

矩阵运算

生成token

6. CPU + GPU 混合运行

一部分计算放 GPU。另一部分留给 CPU。

电脑运行时候大模型的真实情况:

6. CPU消耗啥

① 模型加载

硬盘 → RAM

② CPU上的模型计算

如果模型有一部分没有放到 GPU

CPU

计算

③ 数据处理

Prompt

Tokenizer

Token

这些也可能消耗 CPU。

7. RAM 到底消耗什么

模型权重
+
CPU计算部分
+
GPU传输缓存
+
KV Cache
+
Ollama
+
Windows
+
IDEA
+
Spring Boot

8. GPU 到底消耗什么

GPU主要负责:

大规模并行计算。

比如:

Token

Embedding

Transformer

Attention

Linear

Transformer

...

下一个Token

其中大量矩阵计算可以交给 GPU。

9. GPU利用率和显存占用不是一回事

GPU利用率: GPU计算有多忙。

显存占用: GPU里面放了多少数据.

例如: 5.5GB / 6GB

说明:GPU显存快装满了。

10. 为什么 GPU 会比 CPU 快

100万对的相似的小计算,cpu一个一个串行处理,gpu大量的的并行处理。

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/8/24 13:45:40

双脉冲开关测试中考虑电路寄生影响的波形分析

参考文献:Performance Comparison of Standalone 4H-SiC JFETs and Cascode Devices at Cryogenic Temperature 在双脉冲测试中,器件开关波形受到功率回路寄生电感、续流二极管结电容、器件非线性结电容、封装键合线和内部栅极网络的共同影响。开通过程中…

作者头像 李华
网站建设 2026/8/24 13:45:38

鱼眼相机标定核心参数解析,可定制开发各种视觉测量算法

鱼眼相机标定旨在确定其独特的内部参数和畸变模型,以校正图像并实现精确的几何测量。其核心在于使用更复杂的模型来描述大视场角镜头引入的严重径向畸变。 一、鱼眼相机模型与标定参数 鱼眼相机模型通常使用等距投影模型,其标定参数与普通透视相机有显…

作者头像 李华
网站建设 2026/8/24 13:43:08

如何向 AI 清楚描述一个编程需求

文章目录一、为什么“帮我写代码”通常不够清楚二、描述需求的第一个要素:背景背景通常包含什么为什么背景很重要背景不要写得过多三、描述需求的第二个要素:目标不够具体的目标更清楚的目标目标最好包含“做什么”和“不做什么”四、描述需求的第三个要…

作者头像 李华
网站建设 2026/8/24 13:39:03

Arteris session 1 — NoC Concept and Architecture- 总结

引言 随着现代片上系统(SoC)的复杂度不断提升,传统的总线互连架构在带宽、延迟和可扩展性方面面临严峻挑战。片上网络(Network on Chip, NoC)作为一种分布式、可扩展的互连解决方案,已成为高性能SoC设计的核心。本文基于Arteris的培训资料,系统梳理NoC的核心概念、架构…

作者头像 李华
网站建设 2026/8/24 13:37:58

Android多渠道打包全攻略:从原理到Walle/VasDolly实战避坑

1. 项目背景与核心价值如果你在Android开发团队里待过,或者自己发布过App,大概率都听过“多渠道打包”这个词。听起来挺高大上,但说白了,就是给同一个App包,打上不同的“身份标签”,然后分发给不同的应用商…

作者头像 李华
网站建设 2026/8/24 13:36:49

基于SpringBoot的户外救援系统(毕设源码+文档)

温馨提示:本人主页置顶文章(点我)开头有 CSDN 平台官方提供的学长联系方式的名片! 温馨提示:本人主页置顶文章(点我)开头有 CSDN 平台官方提供的学长联系方式的名片! 温馨提示:本人主页置顶文章(点我)开头有 CSDN 平台…

作者头像 李华