Главное про AI - Вадим Жартун Страница 27

Тут можно читать бесплатно Главное про AI - Вадим Жартун. Жанр: Разная литература / Прочее. Так же Вы можете читать полную версию (весь текст) онлайн без регистрации и SMS на сайте 500book.net или прочесть краткое содержание, предисловие (аннотацию), описание и ознакомиться с отзывами (комментариями) о произведении.
Главное про AI - Вадим Жартун
  • Категория: Разная литература / Прочее
  • Автор: Вадим Жартун
  • Страниц: 101
  • Добавлено: 2026-09-06 20:02:18
  • Внимание! Книга может содержать контент только для совершеннолетних. Для несовершеннолетних просмотр данного контента СТРОГО ЗАПРЕЩЕН! Если в книге присутствует наличие пропаганды ЛГБТ и другого, запрещенного контента - просьба написать на почту pbn.book@yandex.ru для удаления материала


Главное про AI - Вадим Жартун краткое содержание

Прочтите описание перед тем, как прочитать онлайн книгу «Главное про AI - Вадим Жартун» бесплатно полную версию:

Это не научный труд, не художественное произведение и не одна идея, растянутая на 100 страниц, а практическое руководство для тех, кто хочет разобраться в AI — и начать использовать его в работе уже завтра.Это книга для собственников, руководителей, офисных работников — для всех, кто видит в AI перспективу и не хочет полагаться ни на обещания маркетологов, ни на страшилки скептиков.Из неё вы узнаете:- где нейросети обходят человека, а где ему уступают;- когда выбирать облачные модели, когда — локальные, и не переплатить;- как ставить задачи модели, чтобы получать результат;- чем AI-агент отличается от чат-бота и когда он нужен;- какие процессы в продажах, маркетинге и управлении стоит отдавать AI;- как считать ROI от AI-внедрения;- как собрать личный AI-стек и внедрять AI в команде;- как обеспечить безопасность AI;- куда движется индустрия AI.Чек-листы, списки и таблицы помогут вам сориентироваться в теме AI и принять взвешенные решения и том, куда двигаться дальше.

Главное про AI - Вадим Жартун читать онлайн бесплатно

Главное про AI - Вадим Жартун - читать книгу онлайн бесплатно, автор Вадим Жартун

— критичные по качеству задачи.

КВАНТОВАНИЕ: СЖАТИЕ МОДЕЛИ БЕЗ ПОТЕРИ КАЧЕСТВА

Представьте, что модель — это книга, в которой десятки миллиардов чисел (так называемые «веса», параметры нейросети). Каждое число занимает память. Квантование — это способ записать эти числа менее точно, но сэкономить место.

Простой пример. Число 3,14159265 можно записать как «3» (один знак), и это квантование с потерей точности. Для большинства задач «3» достаточно, а не «3,14159265». В квантовании нейросетей работает та же логика: вместо 16-битного числа (огромная точность) записываем 4-битное (16 возможных значений), и точность хранения падает, но для большинства задач это незаметно.

Вот что это даёт на практике. Модель размером 8 ГБ в 16-битном формате после 4-битного квантования превращается в 4 ГБ. На ту же видеокарту влезает модель вдвое большего размера, или та же модель работает вдвое быстрее, или обслуживает вдвое больше пользователей одновременно.

Миф, который стоит развеять сразу: «квантованная модель — это плохо». На практике 4-битное квантование для большинства офисных задач неотличимо от 16-битного оригинала. Качество страдает только в двух сценариях: сложные многошаговые рассуждения (математика, логические цепочки на пять и более шагов) и редкие узкоспециальные термины. Для первого есть метод цепочки рассуждений (когда модель сначала показывает ход мысли, а потом даёт ответ) и приём «несколько примеров» (когда в промпт добавляют 2–5 готовых образцов «вопрос-ответ», и модель продолжает по образцу). Для второго — поиск по вашей базе документов с генерацией ответа (когда модель сначала находит релевантные фрагменты, а потом отвечает по ним). Исследование «Quantization Hurts Reasoning?» (COLM 2025) даёт офисному читателю главное — таблицу дозволенного:

Это значит, что для модели с 7 миллиардами параметров 3-битный квант даёт ошибки, превышающие 10%, и качество становится неприемлемым, а 8-битный — приемлемое.

ВЫБОР КВАНТА ПОД ЗАДАЧУ

Самый популярный квант в экосистеме GGUF — Q4_K_M, и это не случайность. Обзор Kaitchup за октябрь 2025 года формулирует правило прямо: Q4_K_M — рабочая лошадка для 4-битных развёртываний, Q5_K_M — высококачественная настройка с почти незаметной деградацией для большинства задач, Q6_K — выбор, когда нужно «почти без потерь», но всё ещё сэкономить память.

Для офисного пользователя, который открывает Ollama и выбирает тег по умолчанию, Q4_K_M закрывает 90% запросов. Переходить на Q5_K_M или Q6_K имеет смысл, только если вы замерили провал на конкретной задаче. Не «на всякий случай», а по факту.

ЖЕЛЕЗО КАК ОГРАНИЧИТЕЛЬ ВЫБОРА КВАНТА

Железо определяет выбор кванта сильнее, чем выбор модели. На Apple M3 Ultra 96 ГБ разница между Q4_K_M и Q8_0 у Qwen3-14B видна невооружённым глазом: 70,33 токена в секунду против 41,51. Q8 замедляет генерацию почти вдвое. Файл вырастает с 8,32 ГБ до 15,71 ГБ. На 32B-моделях картина жёстче: Q4_K_M даёт 33,88 токена в секунду, Q8_0 — 20,11, а BF16 (16-битный формат, отличается от FP16 расширенным диапазоном) падает до 10,76.

Скорость — не второстепенный параметр. Когда бухгалтер ждёт от модели ответа на «разнеси платёжки по контрагентам», разница между 33 и 11 токенами в секунду превращается из «удобно» в «невозможно работать». Сначала определитесь с железом, потом подбирайте квант под него.

Если задача — «найти баг в распределённой системе по логам», квантование даст о себе знать. В этом случае либо переходите на Q5_K_M / Q6_K, либо возвращайтесь в облако для критичных задач. Для рутинных офисных задач — резюме, черновики, классификация, извлечение данных — локальная 70B-модель в Q4_K_M неотличима от облачной.

НАДСТРОЙКИ ПОВЕРХ ЛОКАЛЬНОЙ МОДЕЛИ

Итак, модель выбрана, квантование настроено, локальный запуск работает. Над этим стеком в 2026 году выстраиваются три слоя, и мы разберём их по очереди: промежуточный инфраструктурный вариант VPS, локальные агенты и обёртки вокруг LLM. А в конце — раздел о безопасности локальной инфраструктуры, где у команд, переехавших с облака на свои серверы, живёт слепое пятно.

VPS: КОМПРОМИССНЫЙ ПРОМЕЖУТОЧНЫЙ ВАРИАНТ

Между «облаком провайдера» и «локальным сервером в офисе» есть третий путь, и для команды 3–6 человек он часто оказывается самым практичным. Это виртуальный частный сервер (VPS, Virtual Private Server) — арендованная виртуальная машина у российского или зарубежного провайдера (Selectel, Timeweb Cloud, Hetzner, AWS Lightsail), где Ollama или vLLM разворачивается как в офисе, но без покупки собственного железа и без отправки данных в публичное облако уровня OpenAI.

По цене в 2026 году типичный VPS с одной дискретной GPU уровня RTX 4090 обходится в 18–30 тысяч рублей в месяц. Для команды с устойчивыми 100+ млн токенов в месяц это дешевле подписки на облачный API и не требует отдельного инженера в штате — провайдер берёт на себя замену дисков, резервное питание и сетевую связность.

Для команды с переменной нагрузкой или с единственным запросом в день VPS проигрывает облаку по гибкости: железо фиксировано, и если задачи встают на паузу, машина всё равно стоит денег.

Выбор между VPS, локальным сервером и облачным API — это выбор между фиксированной ежемесячной ценой (VPS), капитальной затратой с нулевой абонентской платой (локальный сервер) и поштучной оплатой по объёму (облачный API). Подробное сравнение стоимости и требований к железу для VPS раскроем в следующем разделе.

ЛОКАЛЬНЫЕ АГЕНТЫ НА СОБСТВЕННОЙ ИНФРАСТРУКТУРЕ

Над локальной моделью — агенты. Они не просто отвечают на запрос, а сами вызывают инструменты, читают файлы и принимают решения. Локальный агент в 2026 году — это комбинация из LLM (через Ollama или vLLM), фреймворка (LangGraph, CrewAI, AutoGen — библиотеки для построения многошаговых AI-агентов) и набора инструментов (поиск в файлах, доступ к API, запуск скриптов). Все три компонента работают локально, без обращения к облаку. Это полноценная альтернатива облачным агентам типа ChatGPT agent или Claude Computer Use (агент Anthropic, который управляет компьютером как человек — кликает, водит мышью), с одним принципиальным отличием: данные остаются в офисе.

Агенты 2026 года делятся на три класса, и смешение их в одну кучу — типовая ошибка выбора. Универсальные агенты (Hermes Agent, Claude Code) — ассистенты общего профиля, которые умеют читать почту, бронировать встречи, вызывать API, генерировать код. Специализированные агенты для кодинга (Cursor CLI, Aider) — узкие инструменты с глубокой интеграцией в IDE (Integrated Development Environment, интегрированная среда разработки — редактор кода типа VS Code или JetBrains), Git, файловую систему и тестовые фреймворки. Узкие агенты под конкретные вертикали: поддержка (Decagon), продажи (Clay), извлечение данных из документов (Agentic Document Extraction). Три класса — три разных рынка: цена, лицензия, модель

Перейти на страницу:
Вы автор?
Жалоба
Все книги на сайте размещаются его пользователями. Приносим свои глубочайшие извинения, если Ваша книга была опубликована без Вашего на то согласия.
Напишите нам, и мы в срочном порядке примем меры.
Комментарии / Отзывы
    Ничего не найдено.