一.背景介绍

        随着人工智能技术的快速发展,大语言模型(LLMs) 取得了跨越式进展,在自然语言理解、生成、翻译、对话等多个任务中表现出色。然而,真实世界中的信息通常不仅仅以文字存在,更包含大量图像、视频等非结构化内容。为了更好地理解和处理这些多模态信息,多模态大模型(Multimodal Large Language Models,MLLMs) 应运而生。

其中,视觉-语言预训练(Vision-Language Pretraining, VLP) 成为研究与应用的热点。以GPT-4V、LLaVA 系列为代表的新一代多模态模型,不仅能“看图说话”,还能完成复杂的图文问答、视觉推理等任务,广泛应用于电商、医疗、金融、教育等场景。

在实际应用中,电商平台上每天产生大量商品图像,而图文描述的撰写通常依赖人工编辑,效率低、成本高,且风格不一致。为了提升商品上架效率、改善搜索推荐效果,平台迫切需要一种能自动将商品图片转化为简洁准确描述的 AI 方案。

在本篇文章中,我们将详细讲解如何使用 Meta 发布的 Llama 3.2 Vision 模型,结合开源数据集和高效微调框架 Unsloth,构建一个 商品图像 → 文本描述 的智能系统。项目重点探索了如何微调多模态大模型以适配具体任务,解决图像内容向自然语言转换的关键技术挑战。

二.项目步骤详解

1. 环境配置

首先,从镜像地址拉取预训练模型(https://hf-mirror.com/unsloth/Llama-3.2-11B-Vision-Instruct)和数据集(https://hf-mirror.com/datasets/philschmid/amazon-product-descriptions-vlm)至本地,并将其挂载到 BitaHub 工作台的文件存储中。在BitaHub工作台创建开发环境,选择单卡4090 GPU,并通过JupyterLab访问方式进入开发环境。

随后打终端,通过以下命令配置运行环境:

pip install torch==2.4.0 torchvision==0.19.0 --index-url https://download.pytorch.org/whl/cu121
pip install triton==3.0.0
pip install "unsloth[torch]" --upgrade

2.加载Llama 3.2 Vision 模型

LLaMA 3.2 Vision 是 Meta 在 LLaMA 3.1 基础上扩展推出的多模态大模型,具备同时处理图像与文本的能力。该模型通过引入视觉编码器和跨模态注意力机制,使其能够理解图像内容并生成自然语言描述,广泛应用于图像描述、图文问答、文档分析和视觉定位等任务。LLaMA 3.2 Vision 提供 11B 和 90B 两种参数规模,在多个行业标准的图文任务上表现优异,是当前开源社区中领先的视觉语言模型之一。在此项目中,我们将加载Unsloth 提供的 Llama-3.2-11B-Vision-Instruct 模型,该版本针对微调和推理进行了优化。为了减少内存使用和计算需求,我们将以 4 位量化方式加载模型。

from unsloth import FastVisionModel
import torch

# 本地模型文件夹的路径,根据实际情况修改
local_model_path = "/model-202507/Llama-3.2-11B-Vision-Instruct"

model, tokenizer = FastVisionModel.from_pretrained(
    local_model_path,
    load_in_4bit=True,
    use_gradient_checkpointing="unsloth"
)

3.配置 LoRA 微调模块

为了使用 LoRA 训练模型,我们将重点选择和微调特定组件,如视觉层、语言层、注意力模块和 MLP 模块。这使我们能够以最小的架构更改来调整模型以适应特定任务。

model = FastVisionModel.get_peft_model(
    model,
    finetune_vision_layers     = True, 
    finetune_language_layers   = True, 
    finetune_attention_modules = True,
    finetune_mlp_modules       = True,
    r = 16,           
    lora_alpha = 16,
    lora_dropout = 0,
    bias = "none",
    random_state = 3443,
    use_rslora = False,
    loftq_config = None,
)

4.数据加载

从本地加载amazon-product-descriptions-vlm数据集,并选择前 500 个样本。该数据集包含大量亚马逊商品图片及其对应描述,任务目标是构建一个能够根据商品图片生成描述的系统,帮助电商平台提升用户体验与运营效率。

from datasets import load_dataset
dataset = load_dataset("/Dataset/amazon-product-descriptions-vlm/", 
                       split = "train[0:500]")
dataset

查看数据集中某个产品的图像和对应的描述示例:

dataset[100]["image"]

dataset[100]["description"]

5.数据预处理:构造对话式训练样本

在使用多模态大模型进行指令微调(Instruction Tuning)时,我们通常需要将图像与文本结合成一种模型可以理解的对话格式输入,以模拟人类与 AI 的交互场景。以下代码将原始的图像 + 商品描述样本转换为类似 OpenAI 对话结构的格式:

instruction = """
You are an expert Amazon worker who is good at writing product descriptions. 
Write the product description accurately by looking at the image.
"""

这一段定义了微调训练中模型将接收到的指令提示。它模拟了一种角色扮演场景,让模型扮演“亚马逊资深文案”,根据商品图片编写准确的商品描述。这样的提示有助于模型生成符合语境、风格一致的输出文本。

defconvert_to_conversation(sample):
    conversation = [
        {
"role": "user",
"content": [
                {"type": "text", "text": instruction},
                {"type": "image", "image": sample["image"]},
            ],
        },
        {
"role": "assistant",
"content": [{"type": "text", "text": sample["description"]}],
        },
    ]
return {"messages": conversation}

pass

converted_dataset = [convert_to_conversation(sample) for sample in dataset]
converted_dataset[100]

6.模型微调前测试

我们将从数据集中选择第100个样本并对其进行推理,以评估其微调前开箱即用地编写产品描述的能力。

FastVisionModel.for_inference(model) 

image = dataset[100]["image"]

messages = [
    {
"role": "user",
"content": [
            {"type": "image"},
            {"type": "text", "text": instruction},
        ],
    }
]
input_text = tokenizer.apply_chat_template(
    messages, add_generation_prompt=True
)
inputs = tokenizer(
    image,
    input_text,
    add_special_tokens=False,
    return_tensors="pt",
).to("cuda")

from transformers import TextStreamer

text_streamer = TextStreamer(tokenizer, skip_prompt=True)
_ = model.generate(
    **inputs,
    streamer=text_streamer,
    max_new_tokens=128,
    use_cache=True,
    temperature=1.5,
    min_p=0.1
)

描述虽然较长,但结构松散,出现了品牌冗余词、无关图案等现象,需要进一步优化。

7.模型微调

将模型设置为训练模式,并初始化一个监督微调(SFT)训练器,以准备在自定义数据整理器、数据集和优化的训练配置上训练视觉模型,以实现高效微调。

from unsloth import is_bf16_supported
from unsloth.trainer import UnslothVisionDataCollator
from trl import SFTTrainer, SFTConfig

FastVisionModel.for_training(model)  

trainer = SFTTrainer(
    model=model,
    tokenizer=tokenizer,
    data_collator=UnslothVisionDataCollator(model, tokenizer), 
    train_dataset=converted_dataset,
    args=SFTConfig(
        per_device_train_batch_size=2,
        gradient_accumulation_steps=4,
        warmup_steps=5,
        max_steps=30,
        learning_rate=2e-4,
        fp16=not is_bf16_supported(),
        bf16=is_bf16_supported(),
        logging_steps=5,
        optim="adamw_8bit",
        weight_decay=0.01,
        lr_scheduler_type="linear",
        seed=3407,
        output_dir="outputs",
        report_to="none",  
        remove_unused_columns=False,
        dataset_text_field="",
        dataset_kwargs={"skip_prepare_dataset": True},
        dataset_num_proc=4,
        max_seq_length=2048,
    ),
)

启动训练:

trainer_stats = trainer.train()

训练过程中损失平稳下降,说明模型在学习图像与描述之间的映射关系。

8.微调后效果对比

再次使用第 100个样本进行测试:

FastVisionModel.for_inference(model)  

image = dataset[45]["image"]

messages = [
    {
"role": "user",
"content": [
            {"type": "image"},
            {"type": "text", "text": instruction},
        ],
    }
]
input_text = tokenizer.apply_chat_template(
    messages, add_generation_prompt=True
)
inputs = tokenizer(
    image,
    input_text,
    add_special_tokens=False,
    return_tensors="pt",
).to("cuda")

from transformers import TextStreamer

text_streamer = TextStreamer(tokenizer, skip_prompt=True)
_ = model.generate(
    **inputs,
    streamer=text_streamer,
    max_new_tokens=128,
    use_cache=True,
    temperature=1.5,
    min_p=0.1
)

结果显著改善:生成文本更加精准,风格贴近真实商品描述,但仍有少量冗余,建议继续训练完整数据集,训练 3-5 轮以获得最佳效果。

三.总结

本项目以 LLaMA 3.2 Vision 为核心,通过微调实现了一个能够自动生成商品图像描述的智能模型。我们借助亚马逊商品数据集,并结合 Unsloth 微调框架,在资源有限的环境下完成了多模态模型的训练全过程。项目不仅涵盖了模型加载、LoRA 参数设置、数据格式转换、训练与推理等完整流程,还实际验证了微调前后模型在描述准确性与风格一致性上的显著提升。该实践为多模态模型在电商文案自动生成等真实场景中的落地应用提供了清晰可行的参考路径,也为读者深入理解图文生成任务奠定了基础。

温馨提示:

平台暂不支持一键部署,但已提供完整可下载资源,大家可根据教程自行搭建运行。另外,项目部分依赖包版本与最新版存在不适配情况,部署时请务必按照文中标注的具体版本号进行配置,详细依赖需求可查看最新说明,避免因版本问题导致运行异常。

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐