تبدیل متن به تصویر آموزش قدم به قدم و نکات کلیدی

تبدیل متن به تصویر آموزش قدم به قدم و نکات کلیدی

به گزارش مینی کامپیوتر، یک جمله می تواند فقط یک جمله باشد یا نقطه شروع یک تصویر. تفاوت این دو، به روشی برمی گردد که آن جمله را برای هوش مصنوعی توضیح می دهیم.



به گزارش مینی کامپیوتر به نقل از خبر آنلاین، وقتی کاربر می نویسد «یک کافه قدیمی در یک شب بارانی»، هنوز تصویر کاملی به مدل نداده است. اما اگر در رابطه با سوژه، محیط، نور، رنگ، حال وهوا و قاب تصویر توضیح دهد، متن او کم کم به یک دستور تصویری یا «پرامپت» تبدیل می شود. تبدیل متن به تصویر یا Text-to-Image یکی از کاربردهای شناخته شده هوش مصنوعی مولد است. مدلهای هوش مصنوعی مولد می توانند محتوای تازه ای مانند متن، تصویر، ویدئو و صوت تولید کنند. در ابزارهای تصویرساز نیز اصل کار حدودا یکسان است: کاربر باید ایده خویش را به زبانی تبدیل کند که مدل بتواند آنرا برای ساخت تصویر درک کند.

تبدیل متن به تصویر دقیقا چیست؟

ر جست وجوی اینترنتی، کاربر عبارتی را وارد می نماید و موتور جست وجو تصاویر موجود را نمایش می دهد. اما در تبدیل متن به تصویر، هدف پیدا کردن یک تصویر آماده نیست؛ بلکه مدل برمبنای دستور کاربر، تصویری تازه تولید می کند. به عنوان نمونه، با جست وجوی عبارت «مغازه کیک فروشی قدیمی»، احیانا تصاویری را می بینید که قبل تر در اینترنت انتشار یافته اند. اما اگر بنویسید:
«کیک فروشی قدیمی در دل جنگل، نور مه آلود صبح، دودکش بلند، فضای رازآلود، نمای سینمایی»
ابزار تصویرساز تلاش می کند تصویری متناسب با این توصیف ایجاد نماید. همین تفاوت، دلیل اصلی جذابیت فناوری Text-to-Image است. کاربر فقط بدنبال یک تصویر موجود نیست، بلکه می تواند تصویری را متناسب با نیاز خود طراحی کند.

پیش از نوشتن پرامپت، هدف را مشخص کنید

اخت تصویر از انتخاب ابزار آغاز نمی شود؛ از مشخص کردن هدف شروع می شود. قبل از نوشتن پرامپت، به سه پرسش پاسخ دهید:
این تصویر برای چه کاری استفاده می شود؟ مخاطب باید چه مفهومی را از تصویر دریافت کند؟ مهم ترین عنصر تصویر چیست؟
تصویری که برای جلد یک مقاله ایجاد می شود، با تصویری که برای پوستر تبلیغاتی یا پست رسانه های اجتماعی تولید می کنید، نیازهای متفاوتی دارد.

پرامپت را مانند یک دستور عکاسی بنویسید

ک فرمول ساده برای آغاز می تواند این باشد:
مبحث اصلی + محیط + سبک + نور + رنگ + حال وهوا + ترکیب بندی + نسبت تصویر
البته لازم نیست این فرمول همیشه بشکل مکانیکی اجرا شود. هدف این است که عناصر مهم تصویر را روشن و قابل مشاهده توصیف کنید.
برای مثال، اگر بخواهید تصویری برای مقاله ای در رابطه با آشپزی تولید کنید، می توانید بنویسید:
«زن جوانی با چشم های آبی و پیش بند سفید با طرح توت فرنگی، در آشپزخانه ای کاملا مدرن، درحال چشیدن غذایی که پخته است، نور نرم و گرم، نمای متوسط، سبک عکاسی تبلیغاتی.»
در این دستور، سوژه، محیط، اتفاق، نور، سبک و نوع کادر تا حد زیادی مشخص شده است. اگر خروجی بیش از اندازه شلوغ بود، لازم نیست همه متن را از ابتدا تغییر دهید؛ می توانید فقط ترکیب بندی یا تعداد عناصر را اصلاح کنید.

چرا پرامپت کوتاه هم می تواند نتیجه خوبی داشته باشد؟

کی از اشتباه های رایج این است که تصور نماییم هرچه پرامپت طولانی تر باشد، نتیجه بهتر خواهد بود. درحالی که پرامپت های طولانی و پر از دستورهای پیچیده امکان دارد مدل را با اطلاعات متناقض مواجه کنند. راهنماهای رسمی ابزارهایی مانند Midjourney و OpenAI نیز بر روشن بودن هدف، سوژه، محیط و سبک تاکید دارند. در خیلی از موارد، یک تا سه جمله دقیق برای آغاز کافی است. به جای انباشتن صفت ها، جزئیاتی را انتخاب کنید که واقعا در تصویر اهمیت دارند.
نمونه اول: یک ایده ساده «یک شهر آینده نگر.»
این جمله ایده دارد، اما تصویر مشخصی عرضه نمی کند.
نمونه دوم: افزودن جزییات اصلی «شهری آینده نگر در شب، برج های شیشه ای بلند، خودرو های خودران در خیابان خیس، تابلوهای نورانی، مه سبک، فضای سینمایی، نمای باز.»
نمونه سوم: مشخص کردن نور و رنگ «شهری آینده نگر در شب، برج های شیشه ای بلند، خودرو های خودران در خیابان خیس، تابلوهای نورانی، مه سبک، نور آبی و بنفش، فضای سینمایی، نمای باز.»
برای طبیعی تر شدن پرامپت، ابتدا مشخص کنید چه چیزی دیده می شود، سپس توضیح دهید کجا قرار دارد و در نهایت بگویید چطور دیده شود.
مبحث می تواند انسان، حیوان، ساختمان، شیء یا منظره باشد؛ محیط می تواند اتاق، خیابان، جنگل، فضا یا جهانی خیالی باشد؛ سبک می تواند عکاسی مستند، تصویرسازی، نقاشی، طراحی گرافیکی یا نمای سینمایی باشد.

نقش نور، رنگ و حال وهوا در تصویر

قتی می گوییم «نور گرم و نارنجی غروب»، فقط یک خصوصیت زیبایی شناختی به تصویر اضافه نکرده ایم؛ بلکه فضای احساسی آنرا نیز تغییر داده ایم. یک اتاق با نور سفید و شدید می تواند رسمی و سرد به نظر برسد، درحالی که همان اتاق با نور نرم و گرم، حسی صمیمی تر به وجود می آورد.
برای انتقال احساس های مختلف می توانید از این عناصر استفاده کنید:
فضای آرام: نور نرم، رنگ های خنثی، ترکیب بندی ساده؛ فضای رازآلود: مه، سایه های عمیق، نور محدود؛ فضای شاد: رنگ های روشن، نور زیاد، قاب باز؛ فضای ترسناک: راهروی خالی، نور سرد، مه کم و سایه های سنگین؛ فضای لوکس: سنگ مرمر، جزییات فلزی، نورپردازی گرم و طراحی مینیمال.
بهتر است واژه های انتزاعی مانند «زیبا»، «لوکس» یا «ترسناک» را با نشانه های دیداری جایگزین کنید.

ترکیب بندی؛ عاملی که متن را به تصویر نزدیک می کند

و تصویر امکان دارد مبحث یکسانی داشته باشند، اما به علت تفاوت در کادر و ترکیب بندی، کاملا متفاوت به نظر برسند.
نمای نزدیک: تاکید بر چهره یا جزئیات؛ نمای متوسط: نمایش سوژه همراه با قسمتی از محیط؛ نمای باز: ورود محیط و فضای پیرامون به روایت؛ نمای از بالا: عرضه اطلاعاتی متفاوت در رابطه با موقعیت سوژه؛ قاب عمودی: مناسب برای استوری و محتوای موبایلی؛ قاب افقی: مناسب برای مقاله، ویدئو و نمایشگرهای عریض.
در ابزارهایی مانند Midjourney، نسبت تصویر با پارامترهایی مانند --ar تعیین می شود. نسبت 16: 9 برای قاب افقی و 9: 16 برای محتوای عمودی، از انتخابهای رایج هستند. البته نسبت تصویر با اندازه نهائی فایل یکی نیست؛ بلکه فقط نسبت عرض به ارتفاع را مشخص می کند.
استفاده از تصویر مرجع
گاهی هرچقدر توضیح می دهید، خروجی به چیزی که در ذهن دارید نزدیک نمی گردد. در چنین شرایطی، استفاده از تصویر مرجع می تواند مفید باشد.
در Midjourney میان دو مفهوم تفاوت وجود دارد:
Image Prompt: می تواند بر محتوای تصویر، ترکیب بندی و رنگ اثر بگذارد؛ Style Reference: بیشتر برای انتقال ظاهر و حال وهوای بصری، مانند رنگ، بافت، نور و نوع رسانه استفاده می شود.
تصویر مرجع نباید جایگزین توضیح دقیق شود. بهتر است در کنار آن، خصوصیت هایی را که برای شما اهمیت دارند نیز در متن پرامپت بنویسید.
اگر در تصویر به متن نیاز دارید
ساخت پوستر، جلد، اینفوگرافیک یا تبلیغ یک مشکل اضافی دارد: نوشته های داخل تصویر.
در این موارد، خروجی را از نظر موارد زیر بررسی کنید:
املای کلمات؛ اعداد؛ نام ها؛ فاصله میان حروف و کلمات؛ جای گیری تیتر و نوشته ها؛ خوانایی متن در اندازه های مختلف.
اگر کلمه ای در تیتر اشتباه تولید شود، زیبایی تصویر نمی تواند مشکل آنرا جبران کند. برای پروژه های حرفه ای، به طور معمول بهتر است تصویر و متن را جداگانه تولید کنید و نوشته نهائی را در یک نرم افزار طراحی یا ویرایش روی تصویر قرار دهید. این تکنیک کنترل بیشتری روی فونت، اندازه، فاصله و غلط های تایپی به وجود می آورد.
خطاهای رایج در نوشتن پرامپت ۱. استفاده از دستورهای متناقض
اگر همزمان سبک های زیادی را درخواست کنید، خروجی امکان دارد از هدف اصلی فاصله بگیرد. به عنوان نمونه، ترکیب همزمان «عکاسی مستند»، «نقاشی آبرنگ»، «رندر سه بعدی» و «تصویر کارتونی» امکان دارد نتیجه ای نامنسجم ایجاد نماید.
۲. تغییر همه چیز بعد از هر خروجی
اگر پس از هر خروجی، تمام پرامپت را تغییر دهید، متوجه نمی شوید کدام بخش موجب بهبود یا ضعیف شدن تصویر شده است. بهتر است در هر مرحله فقط یک یا دو متغیر اصلی را تغییر دهید.
۳. انتخاب تصویر فقط به علت زیبایی
یک تصویر امکان دارد زیبا باشد، اما پیام مقاله را منتقل نکند. تصویر مناسب، فقط تصویری چشم نواز نیست؛ بلکه باید با مبحث و هدف محتوا ارتباط داشته باشد.
۴. استفاده بیش از اندازه از واژه های انتزاعی
واژه هایی مانند «قشنگ»، «خاص» و «جذاب» برای مدل تصویرساز معنای دقیقی ندارند. بهتر است خصوصیت های دیداری را توضیح دهید.
برای مثال، به جای «یک اتاق زیبا» بنویسید:
«اتاقی مینیمال با دیوارهای سفید، پنجره بزرگ، نور طبیعی صبح، مبلمان چوبی روشن و چند گیاه سبز.»
کاربردهای تبدیل متن به تصویر
تبدیل متن به تصویر در عرصه های مختلف کاربرد دارد:
نویسنده می تواند برای تصویرسازی یک صحنه داستانی از آن استفاده کند؛ گزارشگر می تواند برای برخی مطالب غیرخبری تصویر مفهومی بسازد؛ تولیدکننده محتوا می تواند برای کاور مقاله یا رسانه های اجتماعی ایده بگیرد؛ طراح می تواند چند مسیر بصری اولیه را آزمایش کند؛ کسب وکارها می توانند برای ایده پردازی تبلیغاتی و طراحی کمپین از آن بهره ببرند؛ مدرس ها می توانند مفاهیم آموزشی را به تصویر تبدیل کنند.
تصویر تولیدشده نباید صرفا برای قرار دادن یک کلمه کلیدی در صفحه ساخته شود. اگر مقاله در رابطه با «تبدیل متن به تصویر» است، تصویر باید به درک این فرآیند کمک نماید.
مدیریت حرفه ای تصویر در وب
پس از تولید تصویر، چند نکته فنی نیز اهمیت دارد:
نام فایل را توصیفی انتخاب کنید؛ حجم تصویر را برای سرعت بارگذاری کاهش دهید؛ ابعاد تصویر را متناسب با محل انتشار تعیین کنید؛ از متن جایگزین دقیق استفاده کنید؛ فرمت مناسب مانند WebP را در صورت امکان به کار ببرید.
متن جایگزین باید تصویر را توصیف کند، نه این که لیستی از کلمات کلیدی باشد.
برای مثال، متن جایگزین مناسب می تواند چنین باشد:
«نمایی مفهومی از تبدیل یک جمله متنی به تصویر دیجیتال با استفاده از هوش مصنوعی.»
سئو کلاه سفید از نیاز مخاطب آغاز می شود. اگر تصویر واقعا به فهم مقاله کمک نماید، تجربه کاربر بهتر می شود و محتوا نیز طبیعی تر خواهد بود.
یک فرآیند ساده برای تولید تصویر
برای خارج کردن کار از حالت آزمون وخطای تصادفی، این مراحل را دنبال کنید:
هدف تصویر را مشخص کنید؛ مبحث اصلی را در یک جمله بنویسید؛ محیط و اتفاق را اضافه کنید؛ سبک و نور را تعیین کنید؛ رنگ و حال وهوای تصویر را مشخص کنید؛ ترکیب بندی و نسبت تصویر را انتخاب کنید؛ اولین خروجی را بسازید؛ فقط یک یا دو مشکل اصلی را شناسایی کنید؛ پرامپت را مرحله به مرحله اصلاح کنید؛ بهترین نسخه را انتخاب و قبل از انتشار بررسی کنید. جمع بندی
تبدیل متن به تصویر در ظاهر یعنی نوشتن چند کلمه و دریافت یک تصویر؛ اما در عمل، مهارتی ارتباطی نیز پشت آن قرار دارد. کاربر باید بتواند چیزی را که در ذهن دارد، به عناصر قابل مشاهده تبدیل کند.
فرمول ساده برای آغاز این است:
موضوع، محیط، سبک، نور، رنگ، حال وهوا و ترکیب بندی
لازم نیست همیشه همه این موارد را در پرامپت بنویسید؛ کافی است بخشهایی را مشخص کنید که برای تصویر اهمیت دارند.
بهترین نتیجه به طور معمول از یک پرامپت عجیب و طولانی به دست نمی آید، بلکه حاصل ایده ای روشن، توصیفی دقیق، آزمون مرحله ای و انتخاب آگاهانه است. هوش مصنوعی تصویر را تولید می کند، اما این کیفیت ایده و نگاه کاربر است که به تصویر جهت می دهد.
57
1405/07/05
13:49:18
5.0 / 5
3
تگهای خبر: آینده , اینترنت , تولید , خودرو
این مطلب را می پسندید؟
(1)
(0)
X

تازه ترین مطالب مرتبط
نظرات بینندگان مینی کامپیوتر در مورد این مطلب
لطفا شما هم نظر دهید
= ۲ بعلاوه ۱
مینی کامپیوتر