Multimodal VLM fine-tuning (Qwen2.5-VL-3B via LoRA) on FoodExtract-1k-Vision for image-to-JSON attribute parsing and evaluation.
information-extraction lora food-recognition structured-output quwen vision-language-model json-generation peft-fine-tuning-llm image-to-json
-
Updated
Sep 2, 2026 - Jupyter Notebook