تیم Qwen وابسته به علیبابا، از نسل سوم مدل تصویرسازی خود با نام Qwen-Image-3.0 رونمایی کرد. تمرکز اصلی این نسخه بر تولید تصاویری است که نهتنها ظاهر خوبی داشته باشند، بلکه بهعنوان یک ابزار کاری واقعی در حوزههایی مانند طراحی روزنامه، استوریبورد و رابط کاربری قابل استفاده باشند.
مهمترین جهش فنی Qwen-Image-3.0، پشتیبانی از دستورهای متنی طولانی تا ۴۵۰۰ توکن است. این قابلیت به مدل اجازه میدهد تصاویر بسیار متراکم و پیچیده را در یک مرحله خلق کند. نمونهی شاخصی که برای اثبات این توانایی منتشر شده، یک شبکهی ۳ در ۳ شامل ۹ اینفوگرافیک کاملا متفاوت در موضوعاتی مانند فیزیک، زیستشناسی و ریاضیات است که همگی با یک دستور ۳۷۰۰ توکنی تولید شدهاند.
دومین بهبود کلیدی، دقت در جزئیات ریز است. علیبابا ادعا میکند Qwen-Image-3.0 میتواند متون با اندازهی فونت تنها ۱۰ پیکسل را خوانا رندر کند و بافتهایی مانند پوست، مو و کاغذ را با کیفیتی نزدیک به عکس بازتولید کند. خروجیهای نمایشدادهشده شامل یک صفحهی کامل از مقالهی دانشگاهی با معادلات چندخطی، صفحهی اول شبیهسازیشدهی یک روزنامه و همچنین قابلیتهای ویرایشی مانند افزودن یادداشتهای دستنویس و ترمیم نقاشیهای سنتی آسیبدیده است.
سومین محور، بهکارگیری «دانش جهانی» در مدل است. این سیستم قادر به رندر بومی به ۱۲ زبان، بازتولید رابطهای کاربری مانند صفحات وب و حتی دریافت دادههای زنده از اینترنت برای تولید تصاویر است. برای نمونه، میتواند یک نقشهی پیشبینی آبوهوا برای یک شهر و تاریخ مشخص تولید کند.
علیبابا، مجموع این توانمندیها را برای تولید محتوای حرفهای در بیش از ۱۰۰ سبک بصری، از جمله طراحی روزنامه، ماکتهای رابط کاربری و تصاویر تجارت الکترونیک، هدفگذاری کرده است.
معرفی Qwen-Image-3.0 با یک غیبت بزرگ همراه است. برخلاف نسلهای پیشین که با گزارش فنی، وزنهای متنباز و مجوز آپاچی ۲ منتشر میشدند، برای Qwen-Image-3.0 هیچ جدول بنچمارک، تعداد پارامتر، مجوز یا وزن قابل دانلودی ارائه نشده است.
تمام ادعاهای مطرحشده صرفا بر اساس تصاویر منتخبی است که علیبابا منتشر کرده و کاربران تنها از طریق پلتفرم Qwen Chat میتوانند مدل را آزمایش کنند. این رویکرد در تضاد با رقبایی مانند تنسنت و Thinking Machines Lab است که مدلهای تصویری جدید خود را بهصورت متنباز عرضه کردهاند.
بر اساس بنچمارک اختصاصی Qwen، یعنی Qwen-Image-Bench، نسل قبلی این مدل یعنی Qwen Image 2.0 Pro در رتبهی پنجم کلی قرار داشت و مدلهای GPT Image 2 از OpenAI و مدلهای Nano Banana از گوگل صدرنشین بودند.
خانواده ما
دیدگاهها