Гостевой урок Кирилла Миленького (CEO компании KiriRock, 15 лет в разработке) — практическая установка Cursor с нуля и сборка двух полезных автоматизаций за один присест: разбор PDF из папки в Markdown и локальный транскрибатор аудио/видео в карточки. По формату — пошаговая запись «как я это делаю», без программистского опыта читателя.
Чем Cursor отличается от ChatGPT и подобных
В чатах в браузере, Telegram-ботах и тому подобных сервисах вы можете обсудить тему, придумать идеи, провести исследование. Cursor же позволяет:
- автоматизировать рабочие процессы;
- разрабатывать небольшие (и большие) программы;
- работать прямо с файлами и текстами на компьютере;
- из коротких диалогов с агентом постепенно собирать автоматизацию своей рутины.
Cursor — это не сайт, а программа на компьютере. Главное архитектурное отличие — он работает с папками и файлами локально. Когда вы создаёте проект, вы выбираете папку — и дальше Cursor видит всё, что в ней лежит, и может с этим эффективно работать.
Аналоги: Claude Code Desktop и Codex App от OpenAI. По состоянию на начало июня 2026 Codex и Claude Code всё ещё впереди по моделям, но Cursor догоняет семимильными шагами. Если опыта работы с такими инструментами нет — старт с Cursor хороший вариант.
Подготовка файлов под ИИ
Что внутри папки — должно быть максимально удобно для распознавания моделью:
- Текстовые файлы (.txt, .md) — распознаются быстрее всего.
- Word-файлы — медленнее.
- Картинки и текст на картинках — сложнее всего.
Установка
Скачивание: сайт cursor.com, кнопка под macOS или Windows. Двойной клик, установка как у любой программы. На Mac — перенести в «Программы».
Регистрация: лучше всего через Google-аккаунт. Не использовать российские почтовые сервисы напрямую — могут быть блокировки. Если получится зарегистрироваться с российской — почему бы и нет.
После запуска Cursor открывается в одном из двух видов:
- Классический IDE — слева файлы и папки, по центру редактор, выглядит как программистская среда. Если раньше с разработкой не сталкивались — непривычно.
- Agent Window — простое диалоговое окно с агентом по центру, список проектов слева. Похоже на Codex или Claude Code.
Переключиться: Settings (шестерёнка справа сверху) → Agents → переключатель. Сразу делайте Agent Window — работать удобнее.
Открыть свой проект: иконка папки с плюсом → Open Folder. Выбирать именно папку, не отдельные файлы.
Голосовой ввод вместо клавиатуры
Чем быстрее вы перейдёте с печати на голос, тем эффективнее будете работать с агентами. Когда печатаешь руками — ленишься, пишешь меньше, даёшь меньше контекста. Когда наговариваешь ртом — текст идёт богаче.
Cursor умеет распознавать голос напрямую, но удобнее поставить отдельную программу для распознавания во всех окнах:
- Yink или Handy — оба распознают локально (модель скачивается к вам, ничего не уходит наружу), быстро превращают речь в текст и вставляют в любое поле, где курсор.
Подключение Context 7 — обязательный MCP
У любой нейросети есть отсечка по знаниям: она натренирована на данных до определённой даты, и всё, что позже, не знает. Для новостей можно попросить «сходи и поищи». А вот для библиотек, пакетов и API — нужны актуальные данные, иначе модель напишет код, опираясь на старые версии.
Решение — подключить MCP (Model Context Protocol). Это инструмент, к которому модель сама обращается во время работы, когда ей нужна свежая информация. MCP бывают разные: для документации, для Google Drive, для прочего.
Context 7 — это MCP, который даёт свежие данные по всем библиотекам: как с ними работать, как интегрировать, какая версия актуальна. Без него агент будет генерировать код на старых API.
Установка:
- В Cursor написать: «установи мне MCP Context 7».
- Cursor проверит, не установлен ли уже. Спросит, куда — для всех пользователей или только для текущего.
- Получить API-ключ на сайте context7.com (через Google), создать новый ключ с понятным названием (например, «cursor»), скопировать.
- Cursor покажет файл, куда вставить ключ. Вставить, сохранить.
- Settings → Tools / MCP → Context 7 — должен быть зелёным.
Полезный приём: можно попросить Cursor «получи ключ сам» — иногда работает, иногда нет. Если не может — он развёрнуто объясняет почему.
Режимы работы агента
Внизу окна — переключатель режима:
- Agent — стандартный. Cursor выполняет задачи, работает с файлами, меняет что-то на компьютере.
- Plan — сначала вместе с вами думает. Разрабатывает план; в конце вы переключаетесь в Agent для выполнения. Подходит, когда задача большая и нужно её разбить.
- Ask — режим разговора и поиска решения. Без действий на компьютере. Когда нужен ликбез и обсуждение.
Также есть AutoRun Mode — что Cursor разрешено делать без подтверждения:
- Самый осторожный: вручную подтверждать каждую команду.
- Со «sandbox» — выполнять автоматически в песочнице (изолированной среде), чтобы плохие команды не повлияли на систему.
- Без sandbox — делать всё подряд, что считает нужным в рамках задачи. Опасно, если не знаете, что делаете.
Первая автоматизация — разбор PDF из Inbox в Markdown
Бизнес-логика: вы кладёте PDF в папку Inbox, агент распознаёт его в Markdown, складывает результат в библиотеку, а исходный PDF переносит в «обработанное» с указанием месяца.
Запрос (диктуем голосом, поэтому развёрнутый):
Привет, я первый раз открыл курсор. Я хочу, чтобы мы здесь настроили мой проект. Я хочу класть в папку входящих Inbox PDF-файл, чтобы ты распознал его в Markdown и сложил во внутреннюю библиотеку. Файл из входящих переложить в папку «распознанное» и сохранить для истории. Давай настроим такого агента и подготовим скрипт. Очень важно: задай мне все вопросы, которые помогут настроить этот инструмент лучше именно для меня.
Cursor рассуждает текстом (это особенность LLM — нейросеть «думает», когда пишет). Дальше задаёт ключевой набор вопросов, пишет Python-скрипт (Python выбирается чаще всего по историческим причинам), при необходимости спрашивает разрешение запустить команды.
Результат через несколько минут:
- Создана папка
Libraryс распознанными карточками. - Создана папка «обработанное / месяц / …» с оригинальными PDF.
- Создан README с описанием бизнес-процесса — и для людей, и для будущих ИИ-агентов.
- Создан
requirements.txtдля Python. - Создана инструкция для агента — отдельный Markdown-файл с описанием на русском: что нужно делать и как.
Важная фишка: этого агента не обязательно вызывать как отдельную команду. Достаточно во время обычной работы сказать «разбери мне PDF из входящих» — нейросеть сама поймёт, какого агента вызвать. Можно и явно: «вызови конкретно вот этого агента».
Проверка результата
Заметка «Счёт Яндекс 360» — весь текст распознался, ИИ может с ним работать. Карта партнёра — все реквизиты бренда сразу доступны: можно дать задачу «подставь реквизиты в договор», и они автоматически встанут. Презентация мастер-класса — расписана по слайдам, по тезисам, можно собирать свою презентацию на её основе или брать идеи.
Ограничение: разбор работает только с текстовым слоем в PDF. Если PDF — это просто картинки (отсканированный документ), его не распознать стандартным извлечением. Об этом агент сам предупредил.
Бизнес-процессный подход к разговору с агентом
Главный принцип общения с агентом: вы описываете задачу, правила приёмки (как понять, что задача решена хорошо), но не диктуете, как именно это запрограммировать и как назвать файл.
Не «запрограммируй на Python модуль для парсинга PDF», а «вот в эту папку я буду класть такие-то файлы, мне нужен вот такой результат, важны такие свойства: форматирование, формулировки, такой tone of voice».
Это процессный язык — вы остаётесь на уровне бизнеса, а агент сам выбирает инструменты, языки, библиотеки.
Контекстное окно и когда стартовать новую сессию
В правом нижнем углу показывается, насколько заполнено контекстное окно. Когда переваливает за половину или три четверти:
- Нейросеть начинает галлюцинировать.
- Может придумывать факты.
- Может «подтупливать» — отвечать хуже, чем в начале сессии.
Это сигнал — задачу пора завершать, новую начинать в новой сессии.
Есть встроенные инструменты автоматической компоновки контекста, но они не гарантируют, что в контексте останется именно важное — модель сама пересобирает, поэтому лучше стартовать новый чат на каждую новую задачу.
Вторая автоматизация — локальный транскрибатор аудио и видео
Задача сложнее, потребуется дополнительный софт. Бизнес-логика: класть в Inbox видео или аудио → получать полный транскрипт + карточку с выводами, темами, тегами, оглавлением, цитатами с тайм-кодами.
Зачем карточка, а не сразу весь транскрипт: ограничение контекста. Чем точнее данные в одной сессии — тем точнее ответ. Поэтому маленькая карточка с метаданными + ссылка на полный транскрипт работают лучше, чем 50 минут сырого текста, забивающего окно.
Запрос:
У меня уже есть скрипты и агенты для разбора PDF. Теперь я хотел бы также во входящих разбирать видео и аудио, чтобы получить полноценный транскрипт + карточку с основными выводами и идеями, по которым ты можешь ориентироваться и брать только нужную часть для ответа.
Дальше Cursor задаёт уточняющие вопросы. Принципиально важно отвечать на них развёрнуто:
- Где живёт проект, как им пользоваться — тот же Vault, разбор Inbox, запуск командой «разбери Inbox».
- Типы файлов — лекции, созвоны, голосовые, YouTube-ролики (поровну).
- Форматы — любые, но начнём с того, что есть в Inbox.
- Длительность — до часа.
- Объём — один файл в день.
- Разделение по спикерам — если возможно, хорошо бы.
- Язык — только русский.
- Распознавание — локально (Mac M1).
- Качество — середина: не максимально точно, но без необходимости вручную править.
- Конфиденциальность — нет, данные публичные.
- Карточка должна содержать: резюме, теги/темы, тайм-коды (если удобно агенту), оглавление по смыслу, точные цитаты с тайм-кодами, чтобы агент мог опираться при ответах.
- PDF и медиа в одном Inbox — да, один скилл на разбор всего.
- Именование — на усмотрение агента.
- Конфликты имён — каждый файл новая карточка, не связывать.
Инструменты под капотом
Cursor использует Whisper для распознавания и FFmpeg для работы с аудио/видео. Полезный приём — спросить «а ты дашь мне инструкцию, как всё установить, или сам всё установил?». Уточняющие вопросы помогают понять, что вы действительно всё продумали, а не оставили дыры в постановке.
Cursor сообщил: pdfplumber установлен, fast-whisper не было — только что поставил сам, FFmpeg установлен. Модель пока не скачена — при первом реальном прогоне скачается автоматически (~500 МБ).
Параллельные сессии и мультитаскинг
Когда отправляется новый запрос во время выполнения предыдущего, Cursor спрашивает: запустить в параллели или в текущей сессии. Параллельная — запускает суб-агента с пустым контекстом, не забивает текущий чат. Полезно при долгих операциях.
В случае с разбором часового видео обработка идёт ~15-40 минут. Параллельные сессии можно выключать прямо в интерфейсе.
Результат
На входе — часовое видео выступления (148 МБ). На выходе — Markdown-карточка, содержащая:
- Оглавление по времени.
- Основные тезисы.
- Прямую ссылку на транскрипт.
- Оглавление по смыслу.
- Суть (о чём вообще рассказывается).
- Ключевые идеи, решения, задачи.
- Прямые цитаты.
- Теги для поиска.
Теперь при подготовке презентации можно опираться на идеи отсюда, при поиске «где была мысль про коммуникацию между дизайнерами и разработчиками» — спросить агента, он подскажет в какой карточке.
Цикл Деминга — не пытайтесь сделать идеальный процесс с первого раза
ИИ может очень быстро написать код и автоматизацию (за 40 минут вторая программа), но это не значит, что сразу работает идеально. В голове держите цикл PDCA:
- Собрали что-то.
- Попробовали.
- Увидели проблемы или косяки.
- Вернулись в планирование, описали — сейчас поведение такое, я ожидаю другого.
- Подкрутили.
Первое время процессы будут обтачиваться. Не пробуйте писать сразу идеальный — пишите в каком-то виде и итеративно тюньте. То же касается и скачанных чужих агентов — не бояться менять под себя.
Лимиты и подписки
В уроке Cursor работает на бесплатном тарифе для демонстрации. Лимиты — количество запросов к ИИ, которые можно использовать. В двух задачах (PDF-разбор + транскрибатор) контекстное окно второй сессии заполнилось примерно на 43%, и упёрлись как раз в лимиты подписки.
Бесплатного тарифа в обычной практике довольно много, но на серьёзных задачах быстро упирается. Минимальный платный — около 20 долларов в месяц.
Применимость в повседневной рутине
Та же логика разворачивается на любую входящую информацию:
- Скачивание и разбор почты.
- Чтение и разбор сообщений в мессенджерах.
- Платёжки за квартплату → аналитика начислений.
- Финансовые отчёты.
- Обработка писем.
- Генерация контента.
Если вы пишете курсовую, готовитесь к мастер-классу, собираете научную работу — Cursor становится тенью-помощником, которая помогает быстрее структурировать данные. Не «напиши за меня курсовую», а «помоги мне организовать материалы и держать в голове больше».
Важная оговорка: если вы не эксперт в своей области, ИИ принципиально не сделает работу хорошо. Соберёт красивые презентации, напишет много строчек кода, проведёт исследование — но качество будет так себе. Эксперт + ИИ ≫ просто ИИ.
Главный навык, который остаётся с вами после освоения Cursor — это не программирование и не вайп-кодинг. Главный навык — умение описывать процессы, которые вы хотите автоматизировать. Если вы можете чётко рассказать своему помощнику, что нужно сделать, какие на входе данные и какой ожидаете результат — Cursor сам соберёт инструменты, библиотеки и скрипты. И постепенно превратит рутину в фоновую работу.
За 40-45 минут одной сессии в этом уроке собрано две полноценные автоматизации, за которые специализированные сервисы берут по несколько тысяч рублей в месяц. И это только начало — те же принципы переносятся на финансовые отчёты, контент, базы знаний и любые другие повторяющиеся задачи в работе.