Як запустити ШІ локально на ПК з Windows: Ollama або LM Studio

Покрокова інструкція для Windows: як перевірити RAM і VRAM, вибрати локальну модель, запустити її через LM Studio або Ollama та безпечно ввімкнути локальний API.

Настільний комп’ютер із графічною картою та абстрактною нейронною мережею, що символізує локальний запуск ШІ.

Запустити чат-ШІ локально на Windows можна без програмування. Найпростіший варіант — встановити LM Studio, вибрати невелику модель і працювати через графічний інтерфейс. Якщо потрібні PowerShell, інтеграції або локальний API, зручнішим часто буде Ollama. Обидва інструменти запускають готові моделі на вашому ПК, але результат залежить від пам’яті, обраної моделі та її quantization.

Цей матеріал присвячений практичному встановленню на Windows. Питання приватності, вартості обладнання та компромісів якості детальніше розібрані в окремій статті про локальні AI-моделі.

Документацію та назви елементів інтерфейсу перевірено 31 липня 2026 року. Програми, вимоги й доступні моделі змінюються, тому перед встановленням звіряйте актуальні сторінки розробників.

Що означає «запустити ШІ локально»

У цьому гайді йдеться про inference: комп’ютер завантажує готові ваги мовної моделі в RAM і, за можливості, у VRAM, після чого обчислює відповідь. Це не навчання власної нейромережі й не створення моделі з нуля. Для першого локального чату не потрібні датасет, Python або знання машинного навчання.

Локальним є конкретний ланцюжок обробки, а не просто назва програми. Запит і відповідь можуть залишатися на ПК, якщо використовується завантажена локальна модель без вебпошуку, віддаленого MCP чи хмарного API. Наприклад, Ollama тепер також пропонує cloud-моделі: тег із :cloud означає віддалений запуск, а не роботу на вашій відеокарті.

Ollama чи LM Studio: що вибрати

КритерійLM StudioOllama
Найпростіший стартГрафічний інтерфейс для пошуку, завантаження та чатуЗастосунок і меню є, але PowerShell залишається основним практичним шляхом
Вибір моделіПоказує варіанти GGUF, quantization та приблизну сумісність із пам’яттюЗавантажує модель за коротким тегом із бібліотеки Ollama
Локальний APIВмикається в Developer; типовий порт 1234Працює після встановлення; типовий порт 11434
Кому підходитьПочатківцям і тим, хто хоче чат без командного рядкаТим, хто планує інтеграції, скрипти або локальний сервіс

Для першої перевірки встановіть лише один інструмент. Якщо додати обидва й окремо завантажити ту саму модель у кожен, на диску можуть з’явитися дублікати вагою в кілька гігабайтів.

Крок 1. Перевірте Windows, RAM, VRAM і диск

  1. Натисніть Ctrl + Shift + Esc і відкрийте «Диспетчер завдань».
  2. На вкладці «Продуктивність» виберіть «Пам’ять» і запишіть загальний обсяг RAM.
  3. Виберіть «GPU» та подивіться обсяг виділеної відеопам’яті. Не плутайте його зі спільною GPU-пам’яттю, яка береться із системної RAM.
  4. У «Параметри → Система → Сховище» перевірте вільне місце. Крім програми, потрібен простір для кожної моделі.
  5. Оновіть драйвер відеокарти з офіційного джерела виробника.

За офіційними вимогами LM Studio, для Windows рекомендовано щонайменше 16 ГБ RAM і 4 ГБ виділеної VRAM; на x64-процесорі потрібна підтримка AVX2. Це рекомендація для застосунку, а не гарантія, що будь-яка велика модель запуститься. Ollama вимагає Windows 10 22H2 або новішу; його Windows-інсталятору потрібно щонайменше 4 ГБ, а файли моделей займають додаткове місце.

КонфігураціяРозумний перший тестЧого очікувати
8 ГБ RAMНайменша 2B–4B модель у 4-bit, із закритими зайвими програмамиМожливий запуск, але це нижче рекомендації LM Studio; контекст і швидкість будуть обмежені
16 ГБ RAMНевелика 3B–5B або помірна 7B–8B 4-bit модельПрактична стартова конфігурація, але не універсальна гарантія
32 ГБ RAMБільша модель або довший контекст після перевірки оцінки пам’ятіБільше простору для моделі й робочих програм
Виділена GPUПеренесення частини або всієї моделі у VRAMЗазвичай швидше, якщо модель і драйвер підтримуються

Це орієнтири для першого тесту, а не формула «певна кількість параметрів дорівнює певній RAM». Додаткову пам’ять використовують контекст, KV cache, runtime, Windows і відкриті програми. Розмір завантаженого файла не дорівнює всій потрібній пам’яті.

Крок 2. Виберіть першу модель

  • Шукайте instruct або chat. Base-модель призначена для інших сценаріїв і може гірше виконувати звичайні інструкції.
  • Почніть із малої моделі. Для перевірки встановлення краще швидка 3B–5B, ніж найбільша модель, яку ПК ледве завантажує.
  • Для GGUF почніть із 4-bit. Варіант на кшталт Q4_K_M часто дає практичний баланс між пам’яттю та якістю. Якщо є запас, пізніше порівняйте Q5, Q6 або більшу модель.
  • Перевірте мови. Якщо потрібна українська, протестуйте не лише англійські приклади.
  • Прочитайте ліцензію точного файла або тега. «Open weights» не завжди означає дозвіл на будь-яке комерційне використання.

У командах нижче використано qwen3:4b як невеликий багатомовний приклад, перевірений на момент оновлення гайда. Це smoke test для встановлення, а не твердження, що модель найкраща для кожного завдання. Назви тегів, розміри та доступні версії з часом змінюються.

Варіант 1. Як запустити локальний ШІ через LM Studio

  1. Завантажте LM Studio лише з офіційної сторінки, встановіть і відкрийте застосунок.
  2. Перейдіть у Discover і знайдіть невелику instruct/chat-модель від перевіреного видавця.
  3. Виберіть GGUF-варіант із 4-bit quantization або вище, якщо оцінка пам’яті показує запас. LM Studio пояснює, що нижча точність зменшує файл і вимоги, але може знижувати якість.
  4. Натисніть завантаження й дочекайтеся його повного завершення.
  5. Відкрийте Chat, у model loader виберіть завантажену модель і завантажте її в пам’ять.
  6. Надішліть простий запит: «Відповідай українською. У трьох пунктах поясни різницю між RAM і VRAM».

Якщо модель не завантажується, спробуйте менший файл, 4-bit quantization або коротший context. Якщо відповідь надто повільна, перевірте GPU offload у параметрах завантаження й закрийте програми, які використовують багато RAM або VRAM.

Варіант 2. Як запустити локальний ШІ через Ollama

  1. Завантажте OllamaSetup.exe з офіційної сторінки та встановіть його. Права адміністратора для стандартного встановлення в обліковий запис не потрібні.
  2. Закрийте й заново відкрийте PowerShell, щоб він побачив нову команду.
  3. Спочатку завантажте локальну модель, а потім запустіть її:
ollama pull qwen3:4b
ollama run qwen3:4b

Перша команда завантажує модель, друга відкриває інтерактивний чат. Не використовуйте тег із :cloud, якщо мета — локальний inference. Щоб побачити встановлені та активні моделі, скористайтеся командами з довідки Ollama:

ollama ls
ollama ps

У виводі ollama ps поле PROCESSOR показує, чи працює модель на CPU, GPU або розподілена між ними. Якщо PowerShell не знаходить ollama, перезапустіть термінал; якщо не допомогло — перезапустіть застосунок Ollama з меню «Пуск».

Крок 3. Перевірте, що модель справді працює офлайн

  1. Повністю завантажте модель і отримайте від неї хоча б одну відповідь.
  2. Закрийте чат, вимкніть Wi-Fi або від’єднайте Ethernet.
  3. Відкрийте новий чат із тією самою локальною моделлю та повторіть тестовий запит.
  4. Не вмикайте вебпошук, remote MCP, cloud-модель або іншу зовнішню інтеграцію.

LM Studio підтверджує, що після завантаження моделі без інтернету можуть працювати чат, локальні документи та локальний сервер. Пошук моделей, їх завантаження й отримання runtimes потребують мережі. Для Ollama можна додатково ввімкнути local-only режим: створити користувацьку змінну середовища OLLAMA_NO_CLOUD зі значенням 1 і перезапустити Ollama. Це вимкне cloud-моделі та вебпошук.

Офлайн-тест підтверджує саме перевірений сценарій. Він не доводить, що програма ніколи не перевіряє оновлення після повернення мережі. Для чутливих даних також важливі шифрування диска, безпека Windows, резервні копії та дозволи інших програм. Перед роботою з документами скористайтеся нашим чеклістом приватності для ШІ.

Крок 4. Перетворіть ПК на локальний AI-сервіс

localhost — це адреса поточного комп’ютера. Програма на тому самому ПК може надсилати запити локальній моделі через HTTP, не звертаючись до зовнішнього сервера. Саме це часто мають на увазі під локальним AI-сервісом.

Ollama API

Після встановлення Ollama API зазвичай доступний за адресою http://localhost:11434/api. Перевірити список локальних моделей можна в PowerShell:

Invoke-RestMethod http://localhost:11434/api/tags

LM Studio API

У LM Studio відкрийте Developer і ввімкніть Start server. Типова адреса — http://localhost:1234. Для нових інтеграцій документація рекомендує native API v1; також доступні OpenAI-compatible endpoints. Сервер можна запустити командою lms server start.

Не відкривайте порти 11434 або 1234 в інтернет. Локальний Ollama API не вимагає автентифікації, а LM Studio за замовчуванням також може працювати без токена. Залишайте bind на localhost. Якщо сервіс свідомо потрібен іншим пристроям, потрібні окремі правила firewall, автентифікація, шифрування й контроль доступу; у LM Studio можна ввімкнути API token.

Типові проблеми та швидкі перевірки

ПроблемаЩо перевірити
Команду ollama не знайденоПерезапустіть PowerShell і Ollama; перевірте стандартне встановлення з офіційного інсталятора
Модель не завантажується в пам’ятьОберіть меншу модель або quantization, зменште context, закрийте важкі програми
Відповідь дуже повільнаПеревірте ollama ps або GPU offload у LM Studio; оновіть драйвер
Закінчується дискВидаліть непотрібні моделі; Ollama зберігає їх у C:\Users\%username%\.ollama\models, якщо шлях не змінено
Офлайн-тест не працюєПереконайтеся, що модель і runtime повністю завантажені та не вибрано cloud-модель чи вебпошук

Безпечний перший сценарій

Почніть із невеликої моделі, вигаданого тексту й звичайного чату. Не додавайте одразу документи, MCP-сервери, агентів або доступ до папок. MCP може виконувати код, читати файли й використовувати мережу, тому LM Studio радить встановлювати лише довірені сервери.

Після базового тесту складіть 10–20 реальних, але нечутливих завдань і порівняйте відповіді з очікуваними. Якщо модель потрібна для власних документів, наступним кроком може бути RAG — механізм, який додає знайдені фрагменти до запиту, не перенавчаючи модель. Окремо пояснюємо, як працює RAG і де він помиляється.

Поширені запитання

Чи можна запустити локальний ШІ без відеокарти?

Так. Невеликі quantized-моделі можуть працювати на CPU і системній RAM, але зазвичай повільніше. Почніть із малої моделі та оцініть реальну швидкість до купівлі нового обладнання.

Чи достатньо 8 ГБ RAM?

Для найменших моделей іноді так, але LM Studio рекомендує 16 ГБ. На 8 ГБ доведеться закрити інші програми, вибрати малу 4-bit модель і не завищувати context. Це придатно для проби, але не обіцяє комфортної роботи.

Чи завжди Ollama працює локально?

Ні. Завантажена локальна модель виконується на ПК, але cloud-моделі й вебпошук використовують мережу. Не вибирайте тег :cloud, проведіть офлайн-тест і за потреби встановіть OLLAMA_NO_CLOUD=1.

Що простіше: Ollama чи LM Studio?

Для чату без командного рядка зазвичай простіше LM Studio. Для API, PowerShell і підключення інших програм зручніше Ollama. Якість відповіді визначає насамперед модель і налаштування, а не оболонка.

Чи безкоштовний локальний ШІ?

Програма й окремі моделі можуть бути доступні без оплати за запит, але залишаються витрати на комп’ютер, електроенергію, диск і обслуговування. Ліцензія кожної моделі окремо визначає дозволене використання.

Підсумок

Для першого локального чату на Windows виберіть один інструмент і одну невелику instruct-модель. LM Studio дає простіший графічний шлях; Ollama — короткі команди й готовий локальний API. Перевірте RAM, VRAM і диск, почніть із 4-bit варіанта, протестуйте українську та вимкніть мережу для контрольного офлайн-запуску. Не відкривайте локальний API назовні й не використовуйте чутливі документи, доки не перевірите весь ланцюжок.

Обговорення

Долучайтеся до розмови

Пишіть по суті й поважайте інших читачів. Перший коментар може з’явитися після перевірки редакцією.

Залишити коментар

Ваш email не публікується. Поля зі зірочкою обов’язкові.

Надсилаючи коментар, ви погоджуєтеся на його перевірку та зберігання введених даних відповідно до політики конфіденційності.