3步用transformers调用InternVL3.5-1B-HF:从零到图像对话的简单实战 3步用transformers调用InternVL3.5-1B-HF从零到图像对话的简单实战【免费下载链接】InternVL3_5-1B-HF项目地址: https://ai.gitcode.com/hf_mirrors/OpenGVLab/InternVL3_5-1B-HFInternVL3.5-1B-HF 是商汤开源的 InternVL3.5 多模态视觉语言模型家族中最轻量的一员总参数仅1.1B采用 HuggingFace transformers 官方标准格式只需3步即可在你的电脑上跑通图像对话看图描述、视觉问答甚至让模型先思考再回答。本文带你从零开始快速上手这个多模态大模型。1️⃣ 为什么选择 InternVL3.5-1B-HF在动手之前先花一分钟认识一下这个模型。InternVL3.5 系列的核心架构是ViT – MLP – LLM三段式设计组成模块具体模型参数量作用视觉编码器InternViT-300M0.3B把图片转成语义特征语言模型Qwen3-0.6B0.8B生成自然语言回答足够轻1.1B 总参数消费级显卡甚至 CPU 上都能体验是多模态大模型入门的最佳第一只小熊猫HF 标准格式-HF后缀表示它完全兼容官方 transformers 的 API无需第三方库、无需自定义代码from_pretrained一行加载继承大模型能力与 241B 旗舰版同源支持 Thinking 推理模式、多轮对话适合图像理解、OCR、图表分析等场景。本仓库的 config.json 中记录了模型架构InternVLForConditionalGeneration、视觉编码器配置与分词器类型README.md 则提供了官方完整的 Quick Start 指南建议作为进阶参考。2️⃣ 第一步安装依赖并加载模型环境要求官方建议使用transformers4.52.1以保证模型正常运行torch2.x 即可。pip install -U transformers4.52.1 accelerate接下来只需几行 Python 代码就能把模型加载到 GPUimport torch from transformers import AutoTokenizer, AutoModelForImageTextToText model_path OpenGVLab/InternVL3_5-1B-HF tokenizer AutoTokenizer.from_pretrained(model_path, trust_remote_codeTrue) model AutoModelForImageTextToText.from_pretrained( model_path, torch_dtypetorch.bfloat16, low_cpu_mem_usageTrue, device_mapauto, trust_remote_codeTrue, ).eval()小提示device_mapauto会自动把模型切分到多张 GPU显存紧张时可改用load_in_8bitTrue进行8位量化显存占用直接减半。3️⃣ 第二步传入图片开启图像对话本仓库的 examples/image1.jpg 就是一只可爱的小熊猫我们直接用它来跑通第一句对话。使用apply_chat_template组织对话消息model.generate生成回答from PIL import Image image Image.open(examples/image1.jpg).convert(RGB) messages [ {role: user, content: [ {type: image, image: image}, {type: text, text: 请描述一下这张图片里的动物}, ]}, ] inputs tokenizer.apply_chat_template( messages, add_generation_promptTrue, tokenizeTrue, return_dictTrue, return_tensorspt ).to(model.device) outputs model.generate(**inputs, max_new_tokens256) print(tokenizer.decode(outputs[0][inputs[input_ids].shape[-1]:], skip_special_tokensTrue))运行后模型会输出类似图中是一只小熊猫红熊猫它正趴在木架上毛色呈红棕色……的连贯描述。恭喜你已经完成了从图像到自然语言的多模态推理 多图理解把多张图片依次放入content列表中即可官方建议在提问时用图1、图2编号效果更佳。4️⃣ 第三步开启 Thinking 模式回答更聪明对于需要推理的视觉问题数学题、图表分析InternVL3.5 支持 Thinking 模式——让模型先分步思考、再给出答案。方法是在消息里加一段 system promptR1_SYSTEM_PROMPT You are an AI assistant that rigorously follows this response protocol: 1. First, conduct a detailed analysis of the question. Consider different angles, potential solutions, and reason through the problem step-by-step. Enclose this entire thinking process within and tags. 2. After the thinking section, provide a clear, concise, and direct answer to the users question. Separate the answer from the think section with a newline. .strip() messages.insert(0, {role: system, content: [{type: text, text: R1_SYSTEM_PROMPT}]})⚠️官方推荐参数开启 Thinking 模式时建议do_sampleTrue、temperature0.6可有效避免模型输出重复。5️⃣ 常见问题与进阶建议Q1显存不够 / 想用 CPU 怎么办1B 模型 bf16 加载约需 3GB 显存。显存不足时改用8位量化CPU 环境可去掉device_mapauto并设置torch_dtypetorch.float32速度较慢但完全可用。Q2-HF 格式和 GitHub 格式有什么区别InternVL3.5 系列同时提供两种格式GitHub 自定义格式适合 LMDeploy、vLLM 高速部署和 HF 标准格式本文使用适合 transformers 直接调用与微调实验。两者权重等价。Q3还能做什么除了图像对话InternVL3.5-1B-HF 还具备 OCR 文字识别、图表理解、多语言视觉问答等能力且支持 video_preprocessor_config.json 定义的视频帧处理可用于视频理解实验。相关配置文件作用config.json模型架构视觉编码器 Qwen3 语言模型preprocessor_config.json图像预处理参数448×448 动态高分辨率generation_config.json生成配置起止 tokentokenizer.json分词器词表examples/image1.jpg示例图片可直接用于图像对话 写在最后只用了3步、不到30行代码你就已经跑通了 InternVL3.5-1B-HF 多模态大模型的图像对话全流程加载模型 → 传图提问 → 开启思考模式。这个小而强的视觉语言模型是理解多模态 AI 原理、构建自己的看图说话应用的绝佳起点。更多用法细节如多 GPU 部署、LMDeploy 服务化欢迎继续研读 README.md 中的 Quick Start 与 Deployment 章节动手实验起来【免费下载链接】InternVL3_5-1B-HF项目地址: https://ai.gitcode.com/hf_mirrors/OpenGVLab/InternVL3_5-1B-HF创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考