Кожен ентузіаст Apple завжди мріяв мати повну потужність під рукою, і тепер, з новим чіпом M4, ми можемо говорити про щось набагато більше, ніж просто швидший перегляд веб-сторінок або редагування відео. Ми говоримо про перетворення вашого Mac на повністю локальний, приватний сервер штучного інтелекту. Без інтернету, без щомісячних підписок і без турбот про корпоративне шпигунство за вашими даними. Ідея запуску моделі штучного інтелекту, яка виконує дослідницькі, планові та програмні завдання безпосередньо з вашого жорсткого диска, – це найкращий технологічний досвід, який може отримати користувач Mac сьогодні.

Лабіринт налаштувань та вибору інструментів
Це не так просто, як відкрити програму та завантажити шаблон; вхід у світ локальних шаблонів чимось схожий на складання комп’ютера з нуля. Спочатку потрібно вибрати платформу, на якій буде працювати цей шаблон, будь то Ollama, llama.cpp чи LM Studio. Кожна платформа має свої особливості та обмеження, і не всі вони підтримують однакові шаблони. Потім виникає найбільша проблема: вибір шаблону, який поміщається в 24 ГБ оперативної пам’яті вашого пристрою, залишаючи при цьому достатньо місця для безперебійної роботи інших програм.

Мета полягає в тому, щоб знайти модель, яка забезпечує велике контекстне вікно, бажано 128 000 токенів або більше. Експерименти з такими моделями, як Qwen 3.6 або GPT-OSS 20B, показали, що хоча вони технічно здатні працювати в пам'яті, вони можуть стати практично непридатними для використання через надзвичайну повільність, тоді як менші моделі, такі як Gemma 4B, можуть мати труднощі з реалізацією складних інструментів та завдань.
Некоронований чемпіон: Квен 3.5-9B
Після ретельного тестування з'являється модель qwen3.5-9b@q4_k_s Як найкраще збалансований варіант для MacBook Pro на 24 ГБ, ця модель може похвалитися вражаючою швидкістю до 40 токенів за секунду з увімкненим режимом мислення та можливістю успішного використання програмних інструментів. Хоча іноді вона може здаватися відволікаючою порівняно з більшими хмарними моделями, вона все ж забезпечує видатну продуктивність для ноутбука, який не потребує підключення до мережі.

Для досягнення оптимальних результатів у точних завданнях програмування рекомендується точно налаштувати параметри, такі як встановлення температури на 0.6 та ввімкнення таких опцій, як top_p=0.95. Ці дрібні технічні деталі відрізняють розумну відповідь від тієї, що потрапляє в замкнене коло повторення.
Інтерактивний робочий процес: людина та машина поруч
Будьмо реалістами; нативні моделі, такі як Qwen 3.5, не зовсім готові для створення повноцінного застосунку одним клацанням миші, як це роблять передові хмарні моделі. Натомість вони вимагають інтерактивного робочого процесу, де ви контролюєте процес і використовуєте модель як помічника пошуку або розумну «гумову качку» для миттєвого перегляду коду або згадування деталей складних мов програмування.

Такий підхід до роботи, хоча й вимагає від вас більше розумових зусиль, заохочує вас думати та планувати ефективніше. Ви не делегуєте всі свої роздуми машині; радше використовуєте її як інструмент для підвищення продуктивності, не втрачаючи контролю над проектом. Це цікавий та сталий технологічний досвід, який нагадує нам, чому ми взагалі любили технології: можливість експериментувати з інструментами та досліджувати межі можливого.
Джерело:



Залиште відповідь