چطور هوش مصنوعی را بدون اینترنت اجرا کنیم؛ راهنمای کامل نصب روی لپ‌تاپ و گوشی
کد خبر : ۹۵۶۹۴۳
|
تاریخ : ۱۴۰۵/۰۶/۰۳
-
زمان : ۲۱:۰۱
|
دسته بندی: اخبار فناوری

چطور هوش مصنوعی را بدون اینترنت اجرا کنیم؛ راهنمای کامل نصب روی لپ‌تاپ و گوشی

با نصب هوش مصنوعی آفلاین، بدون اینترنت هم می‌توانید روی لپ‌تاپ یا گوشی با مدل‌های هوش مصنوعی به‌صورت رایگان، سریع و با حفظ حریم خصوصی چت کنید.

با نصب هوش مصنوعی آفلاین، بدون اینترنت هم می‌توانید روی لپ‌تاپ یا گوشی با مدل‌های هوش مصنوعی به‌صورت رایگان، سریع و با حفظ حریم خصوصی چت کنید.

قطعی اینترنت برای بسیاری از کاربران ایرانی یک سناریوی فرضی نیست؛ تجربه‌ای تکرارشونده است. پیش‌تر در چنین شرایطی دسترسی به سرویس‌های هوش مصنوعی هم عملاً از بین می‌رفت، اما این تصور دیگر کاملاً درست نیست. امروز بخشی از مدل‌های زبانی به‌گونه‌ای طراحی شده‌اند که بدون اتصال به سرورهای ابری، مستقیماً روی خود دستگاه اجرا شوند.

اجرای محلی (Local) هوش مصنوعی به شما اجازه می‌دهد حتی در حالت کاملاً آفلاین با مدل کار کنید. از طرف دیگر، در این حالت چون داده‌ها برای پردازش از دستگاه خارج نمی‌شوند، می‌تواند به حفظ حریم خصوصی نیز کمک کند. مهم‌تر این که در بسیاری از موارد می‌توانید به‌طور رایگان از مدل‌های هوش مصنوعی آفلاین استفاده کنید. البته منظور از رایگان در اینجا، مدل‌های سبک و متن‌بازی است که شرکت‌هایی مانند گوگل برای اجرای روی سخت‌افزارهای شخصی منتشر کرده‌اند، نه نسخه‌های کامل و پولی سرویس‌های ابری.

این مدل‌های سبک که با عنوان SLM یا مدل‌های زبانی کوچک شناخته می‌شوند، با هدف اجرای مدل‌های هوش مصنوعی روی سخت‌افزارهای معمولی توسعه یافته‌اند؛ به‌طوری که برای استفاده از آن‌ها به ابرکامپیوتر نیاز ندارید و در برخی موارد می‌توانید یک مدل را روی لپ‌تاپ یا حتی گوشی هوشمند خود اجرا کنید.

این ابزارها قرار نیست جایگزین دستیارهای قدرتمند ابری شوند، اما برای لحظاتی که اینترنت قطع است، یا برای کارهایی که حریم خصوصی داده در آن‌ها اهمیت دارد، گزینه‌ای واقعی و در دسترس‌اند. در ادامه، روش نصب و اجرای هوش مصنوعی بدون نیاز به اینترنت را آموزش می‌دهیم و راهنمای کاملی برای نصب و استفاده از آن روی لپ‌تاپ و گوشی ارائه می‌کنیم.

پیش از نصب هر نرم‌افزاری، باید بدانید دستگاه‌تان از پس چه مدلی برمی‌آید. اجرای هوش مصنوعی (یا به‌اصطلاح Inference) به‌شدت به حافظه وابسته است؛ اما نه حافظه‌ی ذخیره‌سازی، بلکه رم و به‌خصوص VRAM

رم همان حافظه‌ی موقتی است که پردازنده‌ی اصلی (CPU) روی آن کار می‌کند. اما هوش مصنوعی عاشق پردازش موازی است و کارت گرافیک (GPU)، با هزاران هسته‌ی ریز خود، این کار را بسیار سریع‌تر از CPU انجام می‌دهد.

کارت گرافیک هم حافظه‌ی اختصاصی خودش را دارد که به آن VRAM می‌گویند. حالت ایده‌آل این است که کل مدل در همین VRAM جا شود؛ اگر جا نشود، بخشی از آن به رم منتقل می‌شود که سرعت را به‌شدت پایین می‌آورد.

لپ‌تاپ‌های گیمینگ با کارت گرافیک مجزا برای این کار مناسب‌اند؛ اما مک‌بوک‌های اپل با تراشه‌های سری M (و لپ‌تاپ‌های ویندوزی جدید با معماری مشابه) یک استثنای جالب به نام حافظه‌ی یکپارچه یا Unified Memory دارند که در آن CPU و GPU از یک استخر رم مشترک استفاده می‌کنند؛ یعنی یک مک‌بوک با ۳۲ یا ۶۴ گیگابایت رم، عملاً همان مقدار VRAM هم در اختیار دارد.

اگر سخت‌افزار قوی ندارید، جای نگرانی نیست؛ اینجا تکنیکی به اسم کوانتیزیشن (Quantization) به کمک می‌آید. این فرایند دقت اعداد داخل مدل را پایین می‌آورد؛ مثلاً از ۱۶ بیت به ۴ بیت. نتیجه این است که مدلی با ۷ یا ۸ میلیارد پارامتر که معمولاً حدود ۱۴ تا ۱۶ گیگابایت حجم دارد، به چهار تا پنج گیگابایت فشرده می‌شود و روی یک سیستم معمولی با ۸ گیگابایت رم هم قابل‌اجراست اما به قیمت افت جزئی در دقت پاسخ‌ها.

برای این‌که مجبور نباشید هر بار محاسبه کنید، جدول زیر یک راهنمای کلی و تقریبی برای انتخاب مدل مناسب است:

رم + VRAM در دسترس

دستگاه مناسب

اندازه‌ی مدل پیشنهادی

مثال

کمتر از ۴ گیگابایت

گوشی میان‌رده یا قدیمی

زیر ۱ میلیارد پارامتر (مثلاً Gemma 4 E2B)

Gemma 4 نسخه‌ی E2B

۴ تا ۸ گیگابایت

گوشی پرچم‌دار / لپ‌تاپ بدون گرافیک مجزا

حدود ۲ تا ۴ میلیارد پارامتر (کوانتایزشده)

Gemma 4 نسخه‌ی E4B

۸ تا ۱۶ گیگابایت

لپ‌تاپ معمولی یا گیمینگ سبک

حدود ۷ تا ۸ میلیارد پارامتر (کوانتایزشده)

Llama یا Qwen در رده‌ی ۷ تا ۸ میلیارد پارامتر

۱۶ گیگابایت یا بیشتر

لپ‌تاپ گیمینگ یا مک‌بوک با رم بالا

۱۲ میلیارد پارامتر به بالا

نسخه‌های بزرگ‌تر خانواده‌ی Gemma یا Qwen

این اعداد تقریبی‌اند و به نوع کوانتیزیشن و بهینه‌سازی هر اپلیکیشن هم بستگی دارند؛ اما به‌عنوان نقطه‌ی شروع، از هدررفت وقت برای دانلود مدلی که اصلاً روی دستگاه‌تان جا نمی‌شود جلوگیری می‌کند.

اگر در فهرست ارائه‌شده چند پردازنده گرافیکی (GPU) وجود دارد، توجه داشته باشید که معمولا یکی از آن‌ها گرافیک یکپارچه پردازنده و بدون VRAM اختصاصی است؛ بنابراین باید کارت گرافیک مجزا را انتخاب کنید.

برای شناسایی مدل‌های آفلاین سازگار با سیستم خود، می‌توانید از وب‌سایت TurboLLM به‌عنوان روشی ساده‌تر کمک بگیرید. این ابزار رایگان و متن‌باز را یک توسعه‌دهنده‌ی مستقل برای همین هدف ساخته است. با وارد کردن میزان رم و VRAM سیستم (یا استفاده از قابلیت تشخیص خودکار ابزار)، فهرستی دقیق از مدل‌هایی که بدون نقص یا با کمترین مشکل روی دستگاهتان اجرا می‌شوند در اختیارتان قرار می‌گیرد.

تا چند وقت پیش، اجرای هوش مصنوعی به‌صورت محلی نیازمند کار با خط فرمان بود. با این حال، اکنون دو ابزار رایگان این فرایند را بدون نیاز به محیط ترمینال تسهیل کرده‌اند که هرکدام برای کاربردی متفاوت مناسب‌تر است.

اولاما (Ollama) که پرطرفدارترین ابزار متن‌باز در این زمینه به شمار می‌رود، از نسخه ۰.۱۰ به بعد یک برنامه رسمی با رابط گرافیکی ارائه کرده است که امکان دریافت مدل‌ها و گفت‌و‌گو با آن‌ها را بدون نیاز به محیط ترمینال فراهم می‌کند.

برای نصب و استفاده از Ollama طبق مراحل زیر پیش بروید:

در فهرست مدل‌های اولاما، کنار برخی گزینه‌ها مانند GLM 5.2 و MiniMax M3 برچسب Cloud درج شده است. این موارد جزو مدل‌های محلی به شمار نمی‌روند و از آنجا که پردازش آن‌ها به‌جای سیستم شما روی سرورهای اولاما انجام می‌شود، استفاده از آن‌ها به اتصال اینترنت و حساب کاربری رایگان اولاما نیاز دارد. برای اجرای کاملاً آفلاین، باید مدل‌های فاقد برچسب Cloud را دریافت کنید؛ مدل‌های خانواده‌ی Gemma در این گروه جای می‌گیرند.

نکته‌ای برای توسعه‌دهندگان: پلتفرم Ollama از نسخه ۰.۱۴ به بعد با API پیام‌رسانی آنتروپیک سازگار شده و از نسخه ۰.۱۵ نیز قابلیت اتصال مستقیم Claude Code به مدل‌های محلی را از طریق دستور ollama launch claude فراهم کرده است. بر این اساس، پس از راه‌اندازی Claude Code، اجرای این دستور در محیط ترمینال فهرستی از مدل‌های نصب‌شده را نمایش می‌دهد که با انتخاب مدل مدنظر، امکان استفاده از یک دستیار برنامه‌نویسی کاملا آفلاین و محلی مهیا می‌شود.

این اپلیکیشن رایگان، روی ویندوز، مک و لینوکس نصب می‌شود و نیازی به ثبت‌نام ندارد. تفاوت اصلی‌اش با Ollama این است که یک فروشگاه مدل داخلی و متصل به Hugging Face دارد؛ یعنی به‌جای وارد‌کردن نام مدل، می‌توانید در همان اپلیکیشن جست‌وجو کنید و با یک کلیک مدل موردنظرتان را دانلود و اجرا کنید.

برای نصب و استفاده از LM Studio طبق مراحل زیر پیش بروید:

نکته‌ای که LM Studio را برای کاربران مک‌بوک جذاب می‌کند این است که از چهارچوب اختصاصی اپل به اسم MLX پشتیبانی می‌کند؛ چهارچوبی که مخصوص بهینه‌سازی روی پردازنده‌های سری M طراحی شده. اگر هنگام دانلود مدل، نسخه‌ی MLX همان مدل (دارای پسوند mlx.) را انتخاب کنید (به‌جای نسخه‌ی معمولی GGUF)، سرعت پاسخ‌دهی روی مک‌بوک به شکل محسوسی بهتر از Ollama خواهد بود؛ در مقابل، اولاما برای کسانی که کار سریع و بی‌دردسر با خط فرمان و اتصال ابزارهایی مثل Claude Code را می‌خواهند، گزینه‌ی ساده‌تری است.

برای اجرای محلی هوش مصنوعی روی گوشی هم دو گزینه در درسترس است. در هر دو گزینه، فقط برای اولین اجرا و دانلود مدل به اینترنت نیاز دارید؛ از آن به بعد، اپلیکیشن حتی در حالت هواپیما هم بدون هیچ مشکلی کار می‌کند.

این اپلیکیشن رسمی و رایگان گوگل، برای اندروید و آیفون در دسترس است و برای استفاده نیازی به ثبت‌نام ندارد. اپلیکیشن Google AI Edge Gallery از قابلیت‌های زیر پشتیبانی می‌کند:

برای نصب و استفاده از Google AI Edge Gallery طبق مراحل زیر پیش بروید:

اگر دنبال محیطی ساده‌تر برای اجرای مدل‌هایی مثل Llama یا Qwen هستید، اپلیکیشن رایگان و بدون نیاز به ثبت‌نام Locally AI برای عملکرد بهتر روی تراشه‌های اپل سیلیکون بهینه شده و مخصوص آیفون، آیپد و مک است.

این اپلیکیشن تا اوایل ۲۰۲۶ توسط LM Studio خریداری و به‌عنوان اپلیکیشن رسمی موبایل این شرکت بازعرضه شد؛ یعنی اگر روی مک‌بوک‌تان LM Studio نصب کرده باشید، این دو اپلیکیشن مکمل هم هستند.

Locally AI به دو روش عمل می‌کند:

برای نصب و استفاده از Locally AI طبق مراحل زیر پیش بروید:

چون پردازنده‌ی گوشی هنگام اجرای این مدل‌ها با تمام توان کار می‌کند، ممکن است دستگاه‌تان کمی گرم شود که کاملاً طبیعی است.

اگر خواستید بعداً از قابلیت LM Link استفاده کنید، کافی است در اپلیکیشن با همان ایمیلی که روی LM Studio نصب‌شده روی مک‌بوک‌تان لاگین کرده‌اید، وارد شوید.

همان‌طور که مشخص است، اجرای محلی هوش مصنوعی دیگر فرایندی پیچیده و منحصر به برنامه‌نویسان نیست. اکنون با استفاده از یک نرم‌افزار رسمی و رایگان روی لپ‌تاپ یا گوشی همراه، می‌توان مدلی را به کار گرفت که کاملاُ مستقل از اینترنت و بدون ارسال اطلاعات به هیچ سروری فعالیت می‌کند. در این میان، تنها پیش‌نیاز، شناخت توان سخت‌افزاری دستگاه برای انتخاب مدل متناسب با آن است.

سرعت پاسخ‌دهی مدل‌های آفلاین معمولا کمی از حالت آنلاین کندتر است

هرچند این مدل‌های کم‌حجم قادر به خطایابی کامل یک پروژه هزارخطی از ابتدا نیستند، اما در وظایفی مانند خلاصه‌سازی متن‌ها، ایده‌پردازی برای محتوا، نگارش نامه‌های رسمی و هر فرآیندی که حفظ محرمانگی اطلاعات در آن اهمیت دارد، عملکرد مناسبی دارند. علاوه بر این، به دلیل انجام مستقیم تمامی مراحل پردازش روی خود دستگاه، سرعت پاسخ‌دهی آن‌ها معمولا کمی از حالت آنلاین کندتر است.

سرعت بالای توسعه در این حوزه امیدوارکننده است؛ بنابراین مدل‌های کنونی ممکن است ظرف چند ماه آینده، بدون نیاز به ارتقای سخت‌افزاری، جای خود را به نسخه‌هایی به‌مراتب قدرتمندتر بدهند.

اگر بخواهید هوش مصنوعی آفلاینی را روی گوشی یا لپ‌تاپ‌تان نصب کنید، مهم‌ترین دلیل‌تان چیست؛ قطعی مکرر اینترنت، حساسیت روی حریم خصوصی داده‌ها، یا صرفاً کنجکاوی برای امتحان‌کردن یک فناوری تازه؟ در بخش دیدگاه‌ها برایمان بنویسید.

خانواده ما

تبلیغات


اشتراک گذاری

دیدگاه‌ها


ارسال دیدگاه