news 2026/8/26 15:38:15

如何快速上手InternVL3_5-4B-HF:从模型下载到首次图文对话的完整新手教程

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
如何快速上手InternVL3_5-4B-HF:从模型下载到首次图文对话的完整新手教程

如何快速上手InternVL3_5-4B-HF:从模型下载到首次图文对话的完整新手教程

【免费下载链接】InternVL3_5-4B-HF项目地址: https://ai.gitcode.com/hf_mirrors/OpenGVLab/InternVL3_5-4B-HF

InternVL3_5-4B-HF是上海AI Lab开源的InternVL3.5 系列多模态大模型的 HuggingFace 标准格式版本(总参数 4.7B)。它原生支持图文对话、视频理解与思维模式推理,无需自定义代码,用官方 transformers 即可直接加载推理,是新手入门开源多模态大模型(MLLM)的理想选择。本教程带你从零开始:下载权重 → 配置环境 → 完成第一次图文对话,全程约 15 分钟 ⏱️。

一、模型亮点:为什么选 InternVL3_5-4B-HF

InternVL3.5 采用"ViT–MLP–LLM"架构,视觉编码器为 InternViT-300M,语言模型基于Qwen3-4B。相比前代 InternVL3,推理性能最高提升 16%,推理速度提升 4.05 倍,并新增 GUI 交互、具身智能等能力。

项目说明
参数量视觉 0.3B + 语言 4.4B(共 4.7B)
上下文长度32K(最大 40960 token)
精度bfloat16(原生)
格式HuggingFace 标准格式,transformers 直接加载
授权Apache-2.0,可免费商用
硬件需求单张 12GB 以上显卡即可(8GB 显卡可 8-bit 量化运行)

💡 HF 格式是官方 Transformers 标准,API 与社区生态完全兼容,后续可无缝接入 LMDeploy、vLLM 部署。

二、模型下载:一条命令获取完整权重

在目标目录下执行以下命令,即可下载全部模型权重(约 10GB):

git clone https://gitcode.com/hf_mirrors/OpenGVLab/InternVL3_5-4B-HF

下载完成后,目录中的关键文件如下,建议对照检查是否完整 ✅:

文件作用
model-00001-of-00002.safetensorsmodel-00002-of-00002.safetensors模型权重(分两个分片存储)
model.safetensors.index.json权重分片索引
config.json模型结构配置(视觉/语言双编码器参数)
tokenizer.jsonvocab.jsonmerges.txt分词器与词表
preprocessor_config.json图像预处理配置(动态高分辨率切片参数)
video_preprocessor_config.json视频帧预处理配置
chat_template.jinja对话模板,图文消息自动拼接
generation_config.json默认生成参数(bos/eos token)
examples/官方示例素材:image1.jpgimage2.jpgred-panda.mp4

三、环境准备:最快配置方法

只需安装 PyTorch 与 transformers,无需任何自定义代码库

pip install torch transformers>=4.52.1

⚠️ 版本要求:请确保transformers >= 4.52.1(模型自带配置为 4.55.0),版本过低会直接报错无法加载。

显卡建议:

  • 12GB 及以上显存:直接以 bfloat16 精度加载,效果最佳;
  • 8GB 显存:加载时加load_in_8bit=True做 8-bit 量化,显存占用约减半;
  • 显存不够/多卡:加device_map="auto"自动切分到多张卡。

四、首次图文对话:描述官方示例中的小熊猫

仓库自带的examples/image1.jpg是一张官方示例图,正好用来做第一次图文对话:

完整推理代码如下(加载模型 + 图文对话,共 20 行以内):

import torch from PIL import Image from transformers import AutoProcessor, AutoModelForImageTextToText model_path = "InternVL3_5-4B-HF" # clone 得到的目录 processor = AutoProcessor.from_pretrained(model_path) model = AutoModelForImageTextToText.from_pretrained( model_path, torch_dtype=torch.bfloat16, low_cpu_mem_usage=True, device_map="auto", # 显存不足时保留,显存充足可删除 ).eval() messages = [{ "role": "user", "content": [ {"type": "image", "image": Image.open("examples/image1.jpg")}, {"type": "text", "text": "请描述一下这张图片,并说出图中的动物"}, ], }] conversation = processor.apply_chat_template( messages, add_generation_prompt=True, tokenize=False) inputs = processor([conversation], images=[Image.open("examples/image1.jpg")], return_tensors="pt").to(model.device) output = model.generate(**inputs, max_new_tokens=512, do_sample=False) print(processor.decode(output[0][inputs["input_ids"].shape[-1]:], skip_special_tokens=True))

运行后,模型会识别出图中的红熊猫(小熊猫),并描述它趴在木板上、背景是树木枝叶的场景 🐾。

验证成功的 3 个信号

  1. 终端出现下载权重后的加载进度,无KeyError/ImportError
  2. 输出一段连贯的中文(或英文)图像描述;
  3. 描述中准确提到"小熊猫/红熊猫"及木桌等关键物体。

五、进阶玩法:思维模式与视频理解

1. 开启思维模式(Thinking Mode)

InternVL3.5 支持"先思考、后回答"的深度推理。只需在对话中加一条 system 消息,引导模型在think标签内逐步分析,并建议设置do_sample=True, temperature=0.6避免输出重复:

messages = [ {"role": "system", "content": [ {"type": "text", "text": "You are an AI assistant that rigorously follows this response protocol: ...(官方 R1_SYSTEM_PROMPT)"}]}, {"role": "user", "content": [ {"type": "image", "image": img}, {"type": "text", "text": "这张图里的动物有几只?"}]}, ]

2. 视频理解

examples/red-panda.mp4配合同目录的video_preprocessor_config.json即可让模型"看视频"。将消息中的type: "image"换成type: "video",传入视频帧序列,模型即可回答视频内容相关问题(对话模板chat_template.jinja已内置<video>占位符,无需手写)。

六、新手常见问题(FAQ)

Q1:加载时报错Image file 'config.json' cannot be found或架构不识别?A:transformers 版本过低,升级到pip install -U transformers(≥ 4.52.1)即可。

Q2:显存不足,OOM 了怎么办?A:三招任选——① 加load_in_8bit=True(需安装bitsandbytes);② 显存充足时去掉device_map="auto"让模型完整进 GPU;③ 输入图片分辨率调低(preprocessor_config.jsonmin_patches=1max_patches=12,动态高分辨率会自动控制 token 数量,一般无需手动干预)。

Q3:可以商用吗?A:可以。项目采用 Apache-2.0 协议,模型组件 Qwen3 同为 Apache-2.0。

Q4:之后想部署成在线服务?A:权重为 HF 标准格式,可直接用 LMDeploy(pip install lmdeploy>=0.9.1)或 vLLM 一键部署为兼容 OpenAI 接口的 API 服务;4B 版本单卡 A100/4090 即可承载。

七、总结

3 步你就完成了 InternVL3_5-4B-HF 的从零上手:

  1. 下载git clone拿到完整权重(约 10GB);
  2. 环境transformers >= 4.52.1+ PyTorch,无需自定义代码;
  3. 对话AutoProcessor+AutoModelForImageTextToText加载,即可描述图片、理解视频、开启思维模式。

接下来可以试试:多轮图像对话、把examples/image2.jpg加进同一轮对话做多图比较,或用 LMDeploy 把它部署成 OpenAI 兼容的 API 服务。祝玩得开心 🎉

【免费下载链接】InternVL3_5-4B-HF项目地址: https://ai.gitcode.com/hf_mirrors/OpenGVLab/InternVL3_5-4B-HF

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/8/26 15:37:44

自己动手写一个tomcat之6log以及pipeline和valve

写在前面 源码 。 本文看下log日志如何设计&#xff0c;并开发valve和pipeline内容&#xff0c;最终将log应用到valve和pipeline中。 1&#xff1a;log 毫无疑问&#xff0c;先定义日志接口&#xff1a; /*** 日志底层接口*/ public interface Logger {public static final…

作者头像 李华
网站建设 2026/8/26 15:33:58

华为MetaERP # EBS 预算主数据 → Fusion BC 预算主数据完整映射实施方法论适用于:迁移蓝图、ETL 规范、主数据梳理工作包、业务调研问卷、数据转换方案整体思路:**先对象对

EBS 预算主数据 → Fusion BC 预算主数据完整映射实施方法论适用于&#xff1a;迁移蓝图、ETL 规范、主数据梳理工作包、业务调研问卷、数据转换方案 整体思路&#xff1a;先对象对齐 → 业务规则对齐 → 字段级映射 → 清洗转换规则定义 → 加载顺序 → 校验方案 → 迁移风险规…

作者头像 李华
网站建设 2026/8/26 15:28:52

PDF批量处理完整指南:用PDF补丁丁把成百上千个文件一口气搞定

PDF批量处理完整指南&#xff1a;用PDF补丁丁把成百上千个文件一口气搞定 【免费下载链接】PDFPatcher PDF补丁丁——PDF工具箱&#xff0c;可以编辑书签、剪裁旋转页面、解除限制、提取或合并文档&#xff0c;探查文档结构&#xff0c;提取图片、转成图片等等 项目地址: htt…

作者头像 李华
网站建设 2026/8/26 15:26:03

BioJava蛋白质结构叠加:CE、FATCAT与TM-align三种算法完整指南

BioJava蛋白质结构叠加&#xff1a;CE、FATCAT与TM-align三种算法完整指南 【免费下载链接】biojava :book::microscope::coffee: BioJava is an open-source project dedicated to providing a Java library for processing biological data. 项目地址: https://gitcode.com…

作者头像 李华