COMANDOS AI ← Журнал
Гайд от практиков

База знаний для ИИ: второй мозг бизнеса за один вечер

База знаний для ИИ — это обычная папка с файлами, а не векторная база. Пошагово: скелет разделов, файл-указатель AGENTS.md и три промпта на каждый день.

15 мин чтения
#База знаний#AI#AI-агенты#Гайды#Автоматизация#Малый бизнес
Определение

База знаний для ИИ — это папка с текстовыми файлами на вашем диске, которую модель читает перед ответом. Нейросеть не дообучается на ваших документах: она каждый раз заново читает то, что вы положили ей на стол. Первый уровень собирается за вечер — скелет папок, файл-указатель и правило «числа в таблицы, смыслы в заметки». Векторная база на этом уровне не нужна.

«Расскажи, почему плановая маржа за июль ниже нормы». Этот вопрос я задал со своего телефона, стоя не в офисе. Через минуту пришёл отчёт: сколько маржи недобрали, какие объекты её съели, что делать — пересобрать смету по одному объекту, остановить счётчик неустойки, проверить цену договора.

Магии тут нет. Так отвечает любая нейросеть, у которой под рукой ваши данные, разложенные правильно. И наоборот: без данных самый умный ИИ выдаёт «для роста бизнеса нужно улучшать сервис» — вежливо и мимо.

Вся разница между этими двумя ответами — папка на диске. Не сервис, не подписка, не разработчик в штате. Ниже — как собрать её за один вечер и что класть внутрь, чтобы модель перестала угадывать.

Коротко. База знаний для ИИ — это папка с текстовыми файлами на вашем диске, которую модель читает перед ответом. Нейросеть не дообучается на ваших документах: она каждый раз заново читает то, что вы положили ей на стол. Первый уровень собирается за вечер — скелет папок, файл-указатель и правило «числа в таблицы, смыслы в заметки». Векторная база на этом уровне не нужна.

Что такое база знаний для ИИ и почему без неё нейросеть бесполезна

База знаний для ИИ — это не сервис и не векторная база, это папка на вашем диске. Модель не дообучается на ваших документах — она читает их перед каждым ответом, как экзаменатор с идеальной эрудицией и полной амнезией. Умнее от ваших файлов она не становится. Она становится точнее.

Вопрос «как обучить нейросеть на своих данных» почти всегда задают неправильно: обучать её не надо. Надо положить нужное туда, где она это найдёт. Контекст для ИИ-агента — это не длинный промпт на две страницы, а разложенные по типам файлы, к которым он идёт сам. Нейросеть с базой знаний перестаёт угадывать и начинает отвечать по вашим цифрам: не «оптимизируйте воронку», а «сорок из восьмидесяти пяти заявок в июле не взял ни один менеджер, договоров по ним ноль».

Второй мозг для бизнеса устроен так же, как личный, только объект памяти другой — не заметки и идеи, а деньги, клиенты и сроки. И нужен он по простой причине: человек столько не удержит. Психологи оценивают ёмкость рабочей памяти примерно в четыре смысловых блока — в обзоре Нельсона Коуэна 2001 года, сведшем данные десятков экспериментов, речь идёт о «едином центральном пределе в среднем около четырёх чанков», с разбросом от трёх до пяти. Знаменитые «семь плюс-минус два» Джорджа Миллера 1956 года сам Миллер называл скорее приблизительной оценкой и риторическим приёмом. А в бизнесе таких блоков сотни: объекты, клиенты, платежи, обещания, сроки.

Первый уровень — это папка, а не векторная база

Первый уровень базы знаний — обычная папка с текстовыми файлами и один файл-указатель, который объясняет модели, где что лежит. Векторная база данных здесь не нужна, и это главная экономия вечера. Правило, которое я применяю ко всему: берите самый низкий уровень, который решает вашу боль.

Уровни базы знаний выглядят так:

  1. Папка с файлами и указателем — вы здесь.
  2. Разделение чисел и смыслов: таблицы отдельно, заметки отдельно — и здесь тоже.
  3. Поиск по смыслу, векторная база, эмбеддинги.
  4. Синхронизация между устройствами и история версий по каждому файлу.
  5. Несколько агентов на одной базе, агент на своём сервере, расчёты в настоящей БД.

Не путайте эту лестницу с лестницей зрелости в работе с ИИ — там речь про то, что вы умеете делать с моделью, здесь про то, что лежит перед ней. Ступени работы с ИИ я разбирал в отдельном материале, это другой разговор.

Статья доводит ровно до второго уровня и честно на нём останавливается. Supabase, pgvector, автосинхронизация по расписанию, агент на VPS, координация нескольких агентов на одной базе — существуют, работают, но инструкций по ним здесь не будет. Не потому что жалко, а потому что без первого уровня они бессмысленны.

Почему модель галлюцинирует, когда вырывает кусок из документа

Галлюцинации нейросети начинаются там, где из документа вырвали кусок и дописали остальное. Механика простая: договор на пятнадцать страниц режется примерно на пятьдесят чанков, и разрез проходит где придётся — посреди абзаца, посреди условия. Модель вытаскивает кусок, всего остального не видит и уверенно достраивает продолжение.

Правильный ход другой: найденный фрагмент должен указывать, где искать в документе, а не заменять документ. Тогда модель открывает нужное место целиком и перестаёт додумывать. Именно поэтому на старте структура папок работает лучше умного поиска: она сразу приводит к целому файлу.

Чат или агент: инструмент, который умеет писать файлы на диск

Чем ИИ-агент отличается от чата: агент создаёт и правит файлы у вас на диске, а чат отдаёт текст в окно браузера. Для сборки базы годится только первый — иначе вы весь вечер будете копировать текст руками. Разбирать ступени зрелости не нужно, достаточно одного признака и проверки за тридцать секунд.

Три рабочих варианта на 21 августа 2026 года, по одной строке каждый:

Собрать первый вечер можно бесплатно — на тарифе Hobby или на Antigravity. Если база станет рабочим инструментом, закладывайте порядка 20 $ в месяц на подписку агенту. Это одна строка расходов, а не весь бюджет на ИИ: полный расчёт стоимости со всеми подписками и токенами я считал отдельно. Как собрать самого агента и что он вообще умеет — пошаговый разбор здесь; эта статья про то, что положить перед ним.

Тест «создай файл и сходи посмотри»

Не верьте описанию на сайте. Попросите инструмент создать в вашей домашней папке файл proverka.md с текстом внутри и назвать полный путь к нему одной строкой. Отдельно добавьте: если создавать файлы на моём компьютере не умеешь — скажи прямо и не предлагай копировать текст руками.

Теперь идите в папку и посмотрите глазами. Файл есть — у вас агент, продолжайте. Файла нет, а в окне лежит красивый текст «готово, файл создан» — это чат. Проверяется именно наличие файла, а не заявление модели: разница между этими двумя вещами и есть тема всего вечера.

План Б, если агент сегодня не встал

Собрать базу руками можно, просто дольше — примерно плюс сорок минут. Создайте папки мышкой прямо в Finder или Проводнике по дереву из следующего раздела. Промпты сборки отправляйте в любой чат — он выдаст текст файлов, вы сохраните их как новые заметки с нужными именами. Работает. Но каждый следующий вечер без агента будет вдвое медленнее, так что к установке всё равно вернитесь.

Скелет разделов за 15 минут: PARA и числовые префиксы

Структура папок для базы знаний нужна не для красоты — по ней ориентируется модель. Метод PARA даёт четыре верхние папки: проекты, сферы, ресурсы, архив. Числовые префиксы держат порядок, чтобы разделы не прыгали при сортировке. База знаний для бизнеса начинается не с выбора сервиса, а с одной папки на диске.

Вот всё дерево целиком — семь верхних папок и пять подпапок сферы бизнеса:

Obsidian-Vault/
├── 00-Inbox/
│   ├── _NEW_DUMP/     сюда бросаешь всё подряд
│   └── _raw/          оригиналы после разбора, не правим
├── 01-Projects/
├── 02-Areas/
│   └── 21-moy-biznes/
│       ├── strategy/      стратегия, клиенты, решения
│       ├── operations/    как устроена работа, регламенты
│       ├── metrics/       ТОЛЬКО числа и таблицы
│       ├── entities/      клиенты, объекты, люди и связи
│       └── content/       посты, статьи, видео
├── 03-Resources/
├── 04-Archive/
├── 05-Reviews/
└── 06-Decisions/

Про номер 21: двойка означает «второй раздел, то есть Areas», единица — «первая сфера внутри него». Появится вторая сфера — станет 22-й. Какое именно число, неважно совершенно, важно только то, что порядок папок перестаёт меняться. Возьмите 21 и не думайте об этом больше.

Формат файлов — обычный текст с разметкой. База знаний в markdown читается и человеком, и любой моделью, без экспорта, конвертации и привязки к программе: даже если Obsidian завтра исчезнет, папка останется читаемой.

Файл-указатель: как объяснить ИИ, где что лежит

Без указателя модель гадает, с указателем — читает инструкцию. База знаний для ИИ-агента — это те же файлы, только с картой на входе. В корне лежат четыре файла: START_HERE.md — карта для человека, AGENTS.md — правила для модели, VAULT-MAP.md — подробная карта папок, log.md — журнал значимых действий.

Файл AGENTS.md — самый важный из четырёх, и в нём пять правил:

  1. Куда можно писать файлы, а куда нельзя.
  2. Что папку 00-Inbox/_raw/ читают, но никогда не редактируют.
  3. Что числа кладут только в metrics/, а не в текст заметок.
  4. Что каждый новый файл получает шапку с датой и источником.
  5. Что после значимого действия дописывается строка в log.md.

Дальше — проверка, которая занимает две минуты и экономит месяц. Откройте START_HERE.md. Там названы ваши папки и ваш бизнес — или общие слова, которые подошли бы кому угодно? Найдите в нём пример «я получил счёт от клиента, что я делаю»: он есть, и в нём указаны конкретные пути? Если ответ «нет» — не переделывайте руками, напишите агенту: «в START_HERE.md общие слова вместо моей структуры, перепиши под конкретные папки, которые ты только что создал». Это нормальный рабочий цикл, а не поражение.

Главное правило всего этого шага: модель не должна гадать — она должна прочитать инструкцию. Правила задаёте вы, а не она.

Семь вопросов, после которых база становится про ваш бизнес

Пустой скелет бесполезен. Но скелет, набитый примерами про кофейню, которой у вас нет, хуже пустого: он выглядит заполненным, и дальше вся база строится на фальшивке. Поэтому агента разворачивают наоборот — он задаёт семь вопросов по одному и ждёт ответа, и только потом пишет файлы.

Вопросы такие: чем занимается бизнес в двух предложениях вашими словами; кто именно платит деньги и за что; почему выбирают вас, а не соседа; какая одна цифра показывает, хороший месяц или плохой; где эта цифра сейчас лежит и кто её считает; сколько она составила за последний закрытый месяц; что болит сильнее всего прямо сейчас. Отвечать можно коротко и криво — задача не написать красиво, а зафиксировать правду. На «не знаю» агент так и пишет «не знаю, уточнить» с датой, и у вас появляется список дел на завтра.

Если в файлах оказалась кофейня, SaaS или «наша компания стремится» — стоп, агент не спрашивал, а сочинял. Сотрите файлы и потребуйте задать вопросы заново.

Какая цифра у вас главная

Это самое важное решение вечера, и промпт его за вас не примет. Главная метрика — та единственная цифра, по которой вы за десять секунд понимаете, хороший месяц или плохой. И у неё обязан быть источник: место, где её можно посмотреть, а не прикинуть.

Тип бизнесаОбычно главная метрика
Стройка, монтаж, ремонтМаржа по объекту в рублях, рядом — процент готовности и дебиторка
Услуги, агентство, студияВыручка за месяц и загрузка людей
Розница, общепитВыручка за день и средний чек
Опт, поставкиВаловая прибыль на сделку и оборачиваемость склада
Онлайн-подпискаВыручка регулярных платежей за месяц
Обучение, сообществоЧисло активных резидентов и удержание

Не подходит ни одна строка — берите ту цифру, которую вы и так каждый месяц смотрите первой. Она и есть главная.

Сырьё и производное: почему оригинал нельзя править никогда

Сырьё неприкосновенно. Скан счёта, письмо, скриншот переписки, расшифровка голосовой лежат в 00-Inbox/_raw/ и не правятся никогда — даже если вы нашли там опечатку. Из сырья рождается производное: число уходит строкой в таблицу, смысл — в заметку, связь между людьми и объектами — в список сущностей. Так всегда видно, откуда взялся факт.

Маршрут одного документа выглядит так:

  • всё входящее падает в 00-Inbox/_NEW_DUMP/ — сканы, голосовые, скриншоты, не разбирая;
  • промпт разбора вытаскивает из документа числа, смыслы и связи;
  • числа уходят строкой в таблицу в metrics/, смысл — отдельной заметкой в strategy/ или 06-Decisions/, люди и объекты — в entities/;
  • оригинал переезжает в 00-Inbox/_raw/ и остаётся нетронутым навсегда.

Почему это правило жёсткое: отредактированный сырой файл выглядит авторитетно, хотя он уже не сырой. Через полгода непонятно, что было в оригинале и откуда взялось число. Нашли ошибку в расшифровке — создайте новый файл в рабочей папке с исправлением и ссылкой на оригинал. Оригинал остаётся доказательством.

Отдельно про то, что вы туда кладёте. В эту папку поедут жалобы клиентов, счета, переписки — и это нормально, она лежит на вашем диске. Но у персональных данных отдельный правовой режим, и что именно можно отдавать модели, а что нельзя, я разбирал по тексту закона об ИИ и персональных данных.

Деньги считаются, а не ищутся: куда класть цифры

Числа живут в таблицах, таблицы живут в отдельных файлах в папке metrics/. Вопрос про цифру — это подсчёт по строкам, а не поиск похожего абзаца. Спросите поиск по смыслу «сколько мы заработали на Петрове в июне», и он найдёт текст «Петров — хороший клиент, в июне шли активные работы, расходы вроде были невысокие». Похоже на ответ. Но это не цифра.

Вот как выглядит таблица выручки после того, как агент разобрал пачку сканов счетов:

ДатаОбъектКлиентСумма, ₽Статус платежа
2026-06-10Лестница, ул. ПушкинаООО СМУ-5412 000оплачено
2026-06-15Лестница, ул. ПушкинаООО СМУ-580 000в работе

Правильный вопрос к такой таблице: «сколько заработали на объекте „Лестница“ в июне» — сумма считается по строкам. Неправильный: «найди в переписке с Иваном, сколько денег» — считать в тексте нельзя.

Три признака, что цифре пора уходить из текста в таблицу

  1. Одна цифра встречается в трёх местах. В счёте 412 000, в отчёте 412 000, в записке 412 000. Значит, нужен один источник истины, а остальные пусть на него ссылаются.
  2. Нужно сравнивать периоды. Июнь против июля, по какому объекту растёт, по какому падает. Без колонки с датой этого не сделать.
  3. На цифру опираются другие вопросы. Сколько заработали, какой был план, на сколько отклонились.

Правило одной строкой: текст может ссылаться на таблицу, но не наоборот.

Цена вопроса измеряется в часах. В нашем AI-финансовом отделе, где цифры лежат ровно так, разбор первички и отчётность съедали 17 часов в неделю до перестройки и перестали съедать после, а расходы на модель упали с 470 $ в месяц до трёх копеек — потому что модель перестала перечитывать всё подряд в поисках сумм.

Пять типов данных: какой документ где живёт и чем его спрашивать

Каждый документ относится к одному из пяти типов, и у каждого своё место и свой способ спрашивать. Ошибка на этом шаге не выглядит ошибкой: система ответит уверенно и неправильно, а узнаете вы об этом не сразу.

Тип данныхГде живётКак спрашиватьЧто будет, если положить не туда
Точные числа: выручка, платежи, себестоимость, часыТаблица в metrics/Счётом по строкам: «какая выручка за июнь»Цифра внутри текста иногда вытащится, а иногда нет
Смысл, логика, решения: стратегия, регламенты, выводыЗаметки в strategy/ и 06-Decisions/По смыслу: «почему мы перестали работать с этим клиентом»Цифра из середины рассказа даст неточное число
Сущности и связи: клиенты, объекты, кто кого привёлСписок или таблица в entities/По связи: «какие объекты дал этот клиент»Связь, описанная фразой, — это не структура, модель будет гадать
Время и динамика: недельные обзоры, трендыТаблицы с колонкой даты в 05-Reviews/По времени: «как менялась выручка за полгода»Цифры без дат — не видно тренда
Сырьё: скан, письмо, голосовая, выписка00-Inbox/_raw/Напрямую не спрашиваем: сначала разбираемПравите сырьё — теряете первоисточник

Проверять себя проще всего одним вопросом: я сейчас прошу посчитать или объяснить? Счёт идёт в таблицу, объяснение — в заметку. Всё остальное — детали.

Три глагола на каждый день: занести, спросить, проверить

Вся работа с базой — три глагола и три промпта, больше запоминать нечего. Занести — каждый день, полторы минуты: новое падает в папку сброса, промпт раскладывает по типам, оригинал уезжает в сырьё. Спросить — когда возник вопрос, причём ответ, потребовавший нового вывода, тут же возвращается в базу заметкой. Проверить — пятница, десять минут.

Утренний ритуал занимает пять минут. Минута: всё, что вчера прилетело и важно, кидаете в _NEW_DUMP/ не разбирая — фото сметы, скан счёта, расшифровку голосовой. Две минуты: запускаете разбор и читаете, чего агенту не хватило и что он считает противоречием. Две минуты: задаёте один вопрос про сегодняшний день и просите сохранить неочевидный ответ заметкой. По пятницам вместо третьего пункта — ревизия: битые ссылки, файлы-сироты, числа, застрявшие в тексте, противоречия между файлами, залежавшееся входящее.

База, которую не ревизуют, за пару месяца превращается в ту же свалку, из которой вы уходили. Десять минут в пятницу закрывают вопрос.

Как спрашивать обычными словами

Формулируйте так, как сказали бы толковому сотруднику, который в теме. Левая колонка ниже — это когда вы сами сделали работу аналитика и просите машину её оформить. Правая — когда вы отдаёте работу целиком.

❌ Не так✅ А так
«Сделай отчёт по марже в разрезе объектов с разбивкой по прорабам»«Почему маржа просела?»
«Проанализируй воронку продаж и конверсию по этапам»«Что не так с продажами?»
«Сформируй риск-профиль на следующий период»«Где потеряем деньги в августе?»

Правая почти всегда работает лучше, потому что вы не сужаете поиск заранее. Больше того: если на вопрос «почему маржа просела» система не может найти причину сама — это диагноз структуре, а не модели. Значит, цифры лежат не там.

Работа с телефона и что делать с голосовыми

С телефона удобно заносить, а не разбирать. Obsidian есть на iOS и Android бесплатно и открывает ту же папку, если она лежит в облаке. Сфоткали смету — сохранили в _NEW_DUMP/ через мобильное приложение облака. Мелькнула мысль — новая заметка одной строкой туда же. Разбор, ревизия и серьёзные вопросы — вечером за компьютером, потому что агент, который пишет файлы, живёт там.

Отдельный шаг, который обычно пропускают, — расшифровка голосовых. А это самый недооценённый источник: живая голосовая от прораба «клиент жалуется, мол, сроки не держим, прораба видит редко» после разбора становится заметкой в strategy/client-feedback/ и обновлённой связью в entities/clients.yml. Через полгода на вопрос «на что этот клиент жаловался в последний раз» база вернёт вам контекст, который иначе умер бы в мессенджере. Расшифровать проще всего кнопкой в Telegram Premium, приложением-транскрибатором на компьютере или мобильным ИИ, который принимает аудиофайл.

Копия, которая переживёт смерть ноутбука

Копия делается мышкой за десять минут: перетащите папку базы в облако, которым уже пользуетесь — iCloud Drive, Google Диск, Dropbox, Яндекс Диск — и заново откройте хранилище в Obsidian по новому пути. Бесплатно. Альтернатива для тех, кто не хочет возиться, — Obsidian Sync: от 4 $ в месяц при годовой оплате, 5 $ при помесячной, тариф Standard даёт одно хранилище, 1 ГБ и историю версий за месяц.

Сам Obsidian для бизнеса бесплатен, и это не серая зона: в официальном FAQ прямо написано, что платить за коммерческую лицензию вы не обязаны, а лицензия за 50 $ в год на человека — добровольная поддержка разработчиков. Так что вопрос «а мы точно не нарушаем» закрыт.

Чего облачная папка не даёт: это копия, а не совместная работа. Редактировать базу с двух компьютеров одновременно она не позволит — получите файлы вида «конфликтная копия». И от «агент случайно стёр половину» она тоже не спасает: для истории изменений по каждому файлу нужен GitHub, а это уже терминал, токен и отдельные сорок минут. На первом уровне достаточно копии.

И главный аргумент, ради которого база вообще живёт файлами у вас, а не внутри одного сервиса. Я держу её на своём диске — и это не про недоверие к облакам, а про то, что модель сменная, а база нет. Если вся ваша история живёт внутри одного сервиса, то при смене тарифа, блокировке аккаунта или уходе вендора с рынка вы теряете не подписку, а годы накопленного контекста. Файлы на диске переживают смену модели: подключили другого агента — он читает ту же папку.

Шесть граблей первого уровня и что дальше

Шесть ошибок, на которые наступают в первый же месяц. Все шесть выглядят как разумные решения — в этом и проблема: каждая кажется логичным сокращением пути, а аукается переделкой через пару недель. Я прошёл через них сам, когда собирал первую базу в своём бизнесе, и вижу их же у клиентов на практикумах — грабли повторяются один в один, независимо от отрасли.

ГрабляЧем кончаетсяКак правильно
Ждать, что ИИ угадает структуруМодель предложит типовую схему из своего опыта, и переделывать придётся всёПравила задаёте вы, каркас берёте готовый и описываете в AGENTS.md
Редактировать сырьёИстория теряется, через полгода непонятно, откуда взялось числоНашли ошибку — создайте новый файл со ссылкой на оригинал
Одна папка «всё» без правилПоиск даёт восемьдесят результатов, вы кликаете вслепуюПять подпапок сферы плюс index.md с картой в корне
Забыть, откуда взялся фактЧерез полгода выясняется, что цифра была мечтой, а на неё уже сослались триждыШапка в каждом файле: дата, источник, статус draft / reviewed / canon
Не обновлять оглавленияКаждый новый файл становится островом, связи рвутсяОбновляйте index.md сразу после создания значимого файла
Идеальная структура с первого дняПереезд файлов, поехавшие пути, мёртвые ссылкиНачните с базового каркаса, подпапки добавляйте по мере надобности

Первый уровень начнёт жать, когда появятся конкретные симптомы: вместо ответа возвращается кусок текста; на одной базе работают несколько агентов и мешают друг другу; вы работаете с двух устройств и ловите конфликтные копии; цифр стало столько, что нужен настоящий расчёт, а не сложение строк. Вот тогда имеет смысл смотреть на векторный поиск, отдельную базу под числа и автономного агента, который живёт на сервере и работает по расписанию. Пока не жмёт — не трогайте: большинство небольших компаний живут на первом уровне годами и закрывают им 80% задач.

За семь лет консалтинга и 90+ внедрений я почти не встречал компанию, у которой такая база собрана. Все сидят в чате — и там же упираются в потолок, потому что чат каждый раз начинает с чистого листа. Ваше преимущество здесь не в том, что вы знаете сто нейросетей. Оно в том, что у вас есть, что им показать.

Это разбор практика, а не пересказ чужих статей: за плечами 90+ внедрений AI в компаниях, 213 компаний прошли наши практикумы, 2 500+ часов тестирования инструментов и 4 000 000 ₽ собственных вложений в R&D (кто я и чем занимаюсь). Первый уровень базы знаний, описанный выше, я собирал себе в строительном холдинге и с него же начинаю в чужих компаниях — именно потому, что он дешёвый, быстрый и не требует ни разработчика, ни векторной базы. Цены на инструменты сверены с официальными страницами вендоров на 21 августа 2026 года; подписки дорожают быстро, так что перед покупкой загляните на страницу тарифов сами.

А теперь практика. Во вкладке «Гайд» на этой странице лежит то, что превращает статью в собранную базу: шесть шагов вечера с готовым промптом и признаком «получилось» на каждом, 13 копируемых блоков (9 промптов и 4 готовых образца файлов), два чек-листа на 18 пунктов и словарь на 14 терминов, чтобы жаргон не выбивал вас из процесса.

👉 Открыть пошаговый гайд

Хочешь так же в своём бизнесе?

COMANDOS AI — центр AI-автоматизации: готовые паки промптов, команды цифровых сотрудников под процессы бизнеса, обучение и сообщество практиков. Заходи и собирай свою систему.

Открыть COMANDOS AI →