با نصب هوش مصنوعی آفلاین، بدون اینترنت هم میتوانید روی لپتاپ یا گوشی با مدلهای هوش مصنوعی بهصورت رایگان، سریع و با حفظ حریم خصوصی چت کنید.
قطعی اینترنت برای بسیاری از کاربران ایرانی یک سناریوی فرضی نیست؛ تجربهای تکرارشونده است. پیشتر در چنین شرایطی دسترسی به سرویسهای هوش مصنوعی هم عملاً از بین میرفت، اما این تصور دیگر کاملاً درست نیست. امروز بخشی از مدلهای زبانی بهگونهای طراحی شدهاند که بدون اتصال به سرورهای ابری، مستقیماً روی خود دستگاه اجرا شوند.
اجرای محلی (Local) هوش مصنوعی به شما اجازه میدهد حتی در حالت کاملاً آفلاین با مدل کار کنید. از طرف دیگر، در این حالت چون دادهها برای پردازش از دستگاه خارج نمیشوند، میتواند به حفظ حریم خصوصی نیز کمک کند. مهمتر این که در بسیاری از موارد میتوانید بهطور رایگان از مدلهای هوش مصنوعی آفلاین استفاده کنید. البته منظور از رایگان در اینجا، مدلهای سبک و متنبازی است که شرکتهایی مانند گوگل برای اجرای روی سختافزارهای شخصی منتشر کردهاند، نه نسخههای کامل و پولی سرویسهای ابری.
این مدلهای سبک که با عنوان SLM یا مدلهای زبانی کوچک شناخته میشوند، با هدف اجرای مدلهای هوش مصنوعی روی سختافزارهای معمولی توسعه یافتهاند؛ بهطوری که برای استفاده از آنها به ابرکامپیوتر نیاز ندارید و در برخی موارد میتوانید یک مدل را روی لپتاپ یا حتی گوشی هوشمند خود اجرا کنید.
این ابزارها قرار نیست جایگزین دستیارهای قدرتمند ابری شوند، اما برای لحظاتی که اینترنت قطع است، یا برای کارهایی که حریم خصوصی داده در آنها اهمیت دارد، گزینهای واقعی و در دسترساند. در ادامه، روش نصب و اجرای هوش مصنوعی بدون نیاز به اینترنت را آموزش میدهیم و راهنمای کاملی برای نصب و استفاده از آن روی لپتاپ و گوشی ارائه میکنیم.
پیش از نصب هر نرمافزاری، باید بدانید دستگاهتان از پس چه مدلی برمیآید. اجرای هوش مصنوعی (یا بهاصطلاح Inference) بهشدت به حافظه وابسته است؛ اما نه حافظهی ذخیرهسازی، بلکه رم و بهخصوص VRAM
رم همان حافظهی موقتی است که پردازندهی اصلی (CPU) روی آن کار میکند. اما هوش مصنوعی عاشق پردازش موازی است و کارت گرافیک (GPU)، با هزاران هستهی ریز خود، این کار را بسیار سریعتر از CPU انجام میدهد.
کارت گرافیک هم حافظهی اختصاصی خودش را دارد که به آن VRAM میگویند. حالت ایدهآل این است که کل مدل در همین VRAM جا شود؛ اگر جا نشود، بخشی از آن به رم منتقل میشود که سرعت را بهشدت پایین میآورد.
لپتاپهای گیمینگ با کارت گرافیک مجزا برای این کار مناسباند؛ اما مکبوکهای اپل با تراشههای سری M (و لپتاپهای ویندوزی جدید با معماری مشابه) یک استثنای جالب به نام حافظهی یکپارچه یا Unified Memory دارند که در آن CPU و GPU از یک استخر رم مشترک استفاده میکنند؛ یعنی یک مکبوک با ۳۲ یا ۶۴ گیگابایت رم، عملاً همان مقدار VRAM هم در اختیار دارد.
اگر سختافزار قوی ندارید، جای نگرانی نیست؛ اینجا تکنیکی به اسم کوانتیزیشن (Quantization) به کمک میآید. این فرایند دقت اعداد داخل مدل را پایین میآورد؛ مثلاً از ۱۶ بیت به ۴ بیت. نتیجه این است که مدلی با ۷ یا ۸ میلیارد پارامتر که معمولاً حدود ۱۴ تا ۱۶ گیگابایت حجم دارد، به چهار تا پنج گیگابایت فشرده میشود و روی یک سیستم معمولی با ۸ گیگابایت رم هم قابلاجراست اما به قیمت افت جزئی در دقت پاسخها.
برای اینکه مجبور نباشید هر بار محاسبه کنید، جدول زیر یک راهنمای کلی و تقریبی برای انتخاب مدل مناسب است:
رم + VRAM در دسترس
دستگاه مناسب
اندازهی مدل پیشنهادی
مثال
کمتر از ۴ گیگابایت
گوشی میانرده یا قدیمی
زیر ۱ میلیارد پارامتر (مثلاً Gemma 4 E2B)
Gemma 4 نسخهی E2B
۴ تا ۸ گیگابایت
گوشی پرچمدار / لپتاپ بدون گرافیک مجزا
حدود ۲ تا ۴ میلیارد پارامتر (کوانتایزشده)
Gemma 4 نسخهی E4B
۸ تا ۱۶ گیگابایت
لپتاپ معمولی یا گیمینگ سبک
حدود ۷ تا ۸ میلیارد پارامتر (کوانتایزشده)
Llama یا Qwen در ردهی ۷ تا ۸ میلیارد پارامتر
۱۶ گیگابایت یا بیشتر
لپتاپ گیمینگ یا مکبوک با رم بالا
۱۲ میلیارد پارامتر به بالا
نسخههای بزرگتر خانوادهی Gemma یا Qwen
این اعداد تقریبیاند و به نوع کوانتیزیشن و بهینهسازی هر اپلیکیشن هم بستگی دارند؛ اما بهعنوان نقطهی شروع، از هدررفت وقت برای دانلود مدلی که اصلاً روی دستگاهتان جا نمیشود جلوگیری میکند.
اگر در فهرست ارائهشده چند پردازنده گرافیکی (GPU) وجود دارد، توجه داشته باشید که معمولا یکی از آنها گرافیک یکپارچه پردازنده و بدون VRAM اختصاصی است؛ بنابراین باید کارت گرافیک مجزا را انتخاب کنید.
برای شناسایی مدلهای آفلاین سازگار با سیستم خود، میتوانید از وبسایت TurboLLM بهعنوان روشی سادهتر کمک بگیرید. این ابزار رایگان و متنباز را یک توسعهدهندهی مستقل برای همین هدف ساخته است. با وارد کردن میزان رم و VRAM سیستم (یا استفاده از قابلیت تشخیص خودکار ابزار)، فهرستی دقیق از مدلهایی که بدون نقص یا با کمترین مشکل روی دستگاهتان اجرا میشوند در اختیارتان قرار میگیرد.
تا چند وقت پیش، اجرای هوش مصنوعی بهصورت محلی نیازمند کار با خط فرمان بود. با این حال، اکنون دو ابزار رایگان این فرایند را بدون نیاز به محیط ترمینال تسهیل کردهاند که هرکدام برای کاربردی متفاوت مناسبتر است.
اولاما (Ollama) که پرطرفدارترین ابزار متنباز در این زمینه به شمار میرود، از نسخه ۰.۱۰ به بعد یک برنامه رسمی با رابط گرافیکی ارائه کرده است که امکان دریافت مدلها و گفتوگو با آنها را بدون نیاز به محیط ترمینال فراهم میکند.
برای نصب و استفاده از Ollama طبق مراحل زیر پیش بروید:
در فهرست مدلهای اولاما، کنار برخی گزینهها مانند GLM 5.2 و MiniMax M3 برچسب Cloud درج شده است. این موارد جزو مدلهای محلی به شمار نمیروند و از آنجا که پردازش آنها بهجای سیستم شما روی سرورهای اولاما انجام میشود، استفاده از آنها به اتصال اینترنت و حساب کاربری رایگان اولاما نیاز دارد. برای اجرای کاملاً آفلاین، باید مدلهای فاقد برچسب Cloud را دریافت کنید؛ مدلهای خانوادهی Gemma در این گروه جای میگیرند.
نکتهای برای توسعهدهندگان: پلتفرم Ollama از نسخه ۰.۱۴ به بعد با API پیامرسانی آنتروپیک سازگار شده و از نسخه ۰.۱۵ نیز قابلیت اتصال مستقیم Claude Code به مدلهای محلی را از طریق دستور ollama launch claude فراهم کرده است. بر این اساس، پس از راهاندازی Claude Code، اجرای این دستور در محیط ترمینال فهرستی از مدلهای نصبشده را نمایش میدهد که با انتخاب مدل مدنظر، امکان استفاده از یک دستیار برنامهنویسی کاملا آفلاین و محلی مهیا میشود.
این اپلیکیشن رایگان، روی ویندوز، مک و لینوکس نصب میشود و نیازی به ثبتنام ندارد. تفاوت اصلیاش با Ollama این است که یک فروشگاه مدل داخلی و متصل به Hugging Face دارد؛ یعنی بهجای واردکردن نام مدل، میتوانید در همان اپلیکیشن جستوجو کنید و با یک کلیک مدل موردنظرتان را دانلود و اجرا کنید.
برای نصب و استفاده از LM Studio طبق مراحل زیر پیش بروید:
نکتهای که LM Studio را برای کاربران مکبوک جذاب میکند این است که از چهارچوب اختصاصی اپل به اسم MLX پشتیبانی میکند؛ چهارچوبی که مخصوص بهینهسازی روی پردازندههای سری M طراحی شده. اگر هنگام دانلود مدل، نسخهی MLX همان مدل (دارای پسوند mlx.) را انتخاب کنید (بهجای نسخهی معمولی GGUF)، سرعت پاسخدهی روی مکبوک به شکل محسوسی بهتر از Ollama خواهد بود؛ در مقابل، اولاما برای کسانی که کار سریع و بیدردسر با خط فرمان و اتصال ابزارهایی مثل Claude Code را میخواهند، گزینهی سادهتری است.
برای اجرای محلی هوش مصنوعی روی گوشی هم دو گزینه در درسترس است. در هر دو گزینه، فقط برای اولین اجرا و دانلود مدل به اینترنت نیاز دارید؛ از آن به بعد، اپلیکیشن حتی در حالت هواپیما هم بدون هیچ مشکلی کار میکند.
این اپلیکیشن رسمی و رایگان گوگل، برای اندروید و آیفون در دسترس است و برای استفاده نیازی به ثبتنام ندارد. اپلیکیشن Google AI Edge Gallery از قابلیتهای زیر پشتیبانی میکند:
برای نصب و استفاده از Google AI Edge Gallery طبق مراحل زیر پیش بروید:
اگر دنبال محیطی سادهتر برای اجرای مدلهایی مثل Llama یا Qwen هستید، اپلیکیشن رایگان و بدون نیاز به ثبتنام Locally AI برای عملکرد بهتر روی تراشههای اپل سیلیکون بهینه شده و مخصوص آیفون، آیپد و مک است.
این اپلیکیشن تا اوایل ۲۰۲۶ توسط LM Studio خریداری و بهعنوان اپلیکیشن رسمی موبایل این شرکت بازعرضه شد؛ یعنی اگر روی مکبوکتان LM Studio نصب کرده باشید، این دو اپلیکیشن مکمل هم هستند.
Locally AI به دو روش عمل میکند:
برای نصب و استفاده از Locally AI طبق مراحل زیر پیش بروید:
چون پردازندهی گوشی هنگام اجرای این مدلها با تمام توان کار میکند، ممکن است دستگاهتان کمی گرم شود که کاملاً طبیعی است.
اگر خواستید بعداً از قابلیت LM Link استفاده کنید، کافی است در اپلیکیشن با همان ایمیلی که روی LM Studio نصبشده روی مکبوکتان لاگین کردهاید، وارد شوید.
همانطور که مشخص است، اجرای محلی هوش مصنوعی دیگر فرایندی پیچیده و منحصر به برنامهنویسان نیست. اکنون با استفاده از یک نرمافزار رسمی و رایگان روی لپتاپ یا گوشی همراه، میتوان مدلی را به کار گرفت که کاملاُ مستقل از اینترنت و بدون ارسال اطلاعات به هیچ سروری فعالیت میکند. در این میان، تنها پیشنیاز، شناخت توان سختافزاری دستگاه برای انتخاب مدل متناسب با آن است.
سرعت پاسخدهی مدلهای آفلاین معمولا کمی از حالت آنلاین کندتر است
هرچند این مدلهای کمحجم قادر به خطایابی کامل یک پروژه هزارخطی از ابتدا نیستند، اما در وظایفی مانند خلاصهسازی متنها، ایدهپردازی برای محتوا، نگارش نامههای رسمی و هر فرآیندی که حفظ محرمانگی اطلاعات در آن اهمیت دارد، عملکرد مناسبی دارند. علاوه بر این، به دلیل انجام مستقیم تمامی مراحل پردازش روی خود دستگاه، سرعت پاسخدهی آنها معمولا کمی از حالت آنلاین کندتر است.
سرعت بالای توسعه در این حوزه امیدوارکننده است؛ بنابراین مدلهای کنونی ممکن است ظرف چند ماه آینده، بدون نیاز به ارتقای سختافزاری، جای خود را به نسخههایی بهمراتب قدرتمندتر بدهند.
اگر بخواهید هوش مصنوعی آفلاینی را روی گوشی یا لپتاپتان نصب کنید، مهمترین دلیلتان چیست؛ قطعی مکرر اینترنت، حساسیت روی حریم خصوصی دادهها، یا صرفاً کنجکاوی برای امتحانکردن یک فناوری تازه؟ در بخش دیدگاهها برایمان بنویسید.
خانواده ما
دیدگاهها