ИИ-преобразование речи в текст для ВКР: архитектура, метрики и реальный кейс
18 марта 2026 года «МойОфис» анонсировал «Голосовые заметки ИИ» — решение, которое превращает устную речь в структурированный текст за считанные секунды. Для студента технического направления это не просто новостной повод, а готовый предмет исследования: можно разобрать архитектуру транскрибаторов, сравнить подходы, применить методы оценки качества. Ниже — как этот кейс превращается в актуальную ВКР, какие главы и метрики использовать, и как не утонуть в формальностях при защите.
Почему кейс «МойОфис» попадает в тренды ВКР
Распознавание речи перестало быть лабораторной технологией. Теперь это встроенная функция офисных продуктов: врач диктует протокол, юрист — проект договора, студент — лекцию. В дипломных работах появляются задачи, связанные с адаптацией моделей, задержками, точностью и интеграцией с документооборотом. Руководители ожидают, что выпускник понимает не только программный код, но и умеет сравнивать решения, выбирать архитектуру и измеримо доказывать пользу внедрения.
LSI-контекст: автоматическое транскрибирование, микросервисная архитектура, REST API, модели на базе Faster-Whisper, метрика WER (Word Error Rate), стандарты ГОСТ 34.601-89, ISO/IEC 25010, мониторинг через OpenTelemetry, запуск в Kubernetes, CI/CD-пайплайны.
Три темы для ВКР на основе статьи
Тема 1. Разработка сервиса транскрибации лекций с открытой архитектурой
Актуальность: «МойОфис» сделал ставку на мгновенное структурирование речи — значит, рынок требует решений, которые можно внедрять в учебные платформы и корпоративные корпоративные порталы.
Цель: спроектировать и реализовать прототип сервиса преобразования аудио в текст с заданным форматом.
Задачи:
- сравнить существующие API (Vosk, Whisper, SpeechKit) и локальные модели;
- обосновать выбор REST API и очереди задач для асинхронной обработки;
- спроектировать схему БД для хранения транскриптов и метаданных;
- провести нагрузочное тестирование и замерить время ответа.
Структура глав:
- Глава 1. Анализ технологий распознавания речи и требований.
- Глава 2. Проектирование архитектуры: схема компонентов, API, модель данных.
- Глава 3. Тестирование, оценка качества и экономический эффект.
Тема 2. Оценка качества систем распознавания речи в условиях деловой переписки
Актуальность: заявление «МойОфис» о структурированном тексте «выбранного формата» поднимает вопрос — как измерить точность? В дипломе можно исследовать факторы: шум, акцент, специальная терминология.
Цель: разработать методику тестирования транскрибаторов с метриками WER, MER и оценкой пригодности для медицинских или юридических документов.
Задачи:
- собрать корпус аудио с разными акустическими условиями;
- реализовать скрипт для автоматического расчёта WER;
- провести эксперименты минимум на двух моделях;
- сформулировать выводы о минимальном качестве для документов.
Структура глав:
- Глава 1. Методы и подходы к оцениванию систем распознавания.
- Глава 2. Разработка тестового стенда и набора данных.
- Глава 3. Эксперименты, статистическая обработка, рекомендации.
Тема 3. Интеграция голосового ввода в корпоративный документооборот
Актуальность: «МойОфис Голосовые заметки ИИ» — пример импортозамещающего офисного ПО. Для малого бизнеса актуальна задача встраивания транскрибации в 1С или внутренний портал.
Цель: разработать модуль преобразования устных указаний в структурированный текст для системы документооборота.
Задачи:
- проанализировать требования к форматам документов ГОСТ Р 7.0.97;
- разработать схему интеграции через REST API с сервисом транскрибации;
- реализовать интерфейс загрузки аудио и редактирования результата;
- оценить уменьшение времени создания документа.
Структура глав:
- Глава 1. Обзор систем документооборота и способов ввода данных.
- Глава 2. Проектирование ИС: архитектура, сценарии использования, ER-модель.
- Глава 3. Реализация, тестирование, расчёт эффективности.
Что писать в аналитической главе диплома
Используйте статью как пример сдвига рынка: отечественные вендоры внедряют ИИ не как «экспериментальную фичу», а как стандарт офисных продуктов. В аналитике нужно сравнить это решение с открытыми аналогами. Для чего пригодится такая таблица.
| Критерий | «МойОфис Голосовые заметки ИИ» (по данным статьи и аналогов) | Локальный Faster-Whisper | Облачный API |
|---|---|---|---|
| Формат результата | Структурированный текст выбранного шаблона | «Голый» текст с таймкодами | Часто только текст |
| Инфраструктура | Закрытый сервис компании | Собственный сервер / ПК | Облако стороннего вендора |
| Контроль данных | Нет информации | Полный | Зависит от политики |
| Кастомизация | Ограничена шаблонами | Возможна дообучение под терминологию | Не всегда доступна |
Вывод из сравнения — обоснование стека для ВКР: если важна конфиденциальность и нужно дообучение, выбираем локальную модель с открытым кодом. Если нужна скорость внедрения в рамках учебного проекта — можно опираться на публичный API. В дипломе это оформляется как раздел «Сравнительный анализ существующих решений» с обязательными ссылками на источники, включая страницу «МойОфис».
Проектная часть: архитектура сервиса транскрибации
Не копируйте «секретную» архитектуру «МойОфис» — её никто не публиковал. Лучше спроектируйте свою. Для типового диплома достаточно 4 компонентов:
- Клиент (Web/мобильный) — отправка аудио и показ результата;
- API Gateway — приём файлов, авторизация, маршрутизация;
- Очередь + воркер — асинхронная обработка длинных записей (Kafka или RabbitMQ);
- Микросервис транскрибации — модель распознавания + пост-обработка через LLM для форматирования.
Схему можно нарисовать в UML (диаграмма компонентов), но не забывайте про стандарт: для технического проекта в пояснительной записке лучше использовать описание в соответствии с ГОСТ 19.701-90. Покажите в тексте, как частота дискретизации и кодек влияют на размер очереди и время обработки.
POST /api/v1/upload
{
"audio_name": "meeting_2026-08-01.ogg",
"template": "protocol"
}
Response 202 Accepted
{
"task_id": "9f7b...",
"status": "queued"
}
Такой пример в дипломе демонстрирует владение REST-проектированием и понимание асинхронных паттернов. Также можно показать фрагмент Dockerfile или docker-compose для локального запуска модели.
Тестирование и метрики: как измерить «преобразование за секунды»
Чтобы ваша работа выглядела убедительно, в главе тестирования приведите два вида измерений: качество распознавания и производительность.
- WER (Word Error Rate) — процент ошибок на уровне слов. Норма для офисной транскрибации — ниже 10–12%. Используйте его в дипломе как основную метрику.
- Задержка (p95) — время от окончания речи до получения полного текста. У «МойОфис» заявлено «за секунды», значит для вашего прототипа хорошая цель — не более 2–3 секунд на минутный фрагмент.
- Нагрузочное тестирование с помощью k6 или JMeter: 100 параллельных запросов, оценка утилизации CPU/GPU.
- RTO/RPO для раздела надёжности, если это ВКР по ИС. Можно указать, что при отказе воркера транскрипты из очереди не теряются, а RTO составляет не больше 5 минут за счёт рестарта Kubernetes.
Для мониторинга в дипломной работе уместно использовать OpenTelemetry — только добавьте пару абзацев о трассировке запросов от загрузки файла до выдачи результата.
Типичные ошибки студентов
Ошибка 1. Подмена понятий: «Я сделал SaaS» без описания, каким образом реализовано распознавание. Избегайте неопределённости — если вы разработали модуль, который вызывает внешнее API, так и пишите.
Ошибка 2. Отсутствие метрик эффективности. Нельзя заявить «работает быстро» без цифр. Обязательно добавьте замеры WER и времени обработки на вашем тестовом наборе.
Ошибка 3. Игнорирование ГОСТ при оформлении ТЗ. Для дипломной работы по разработке ПО нужно оформлять техническое задание по ГОСТ 34.602-89 или использовать стандарт ГОСТ 19.102-77 для стадий разработки. Даже краткое ТЗ на 2–3 страницы снимает вопросы комиссии.
Чек-лист перед сдачей
- ✅ Ссылка на статью-первоисточник (cnews.ru) оформлена корректно, дата указана.
- ✅ Формулировки целей и задач точно соответствуют содержанию глав и выводам.
- ✅ В аналитической главе есть минимум одна сравнительная таблица решений.
- ✅ Приведены метрики: WER, задержка ответа, нагрузка на CPU/GPU.
- ✅ Диаграммы архитектуры имеют подписи и соответствуют ГОСТ или UML-нотации.
- ✅ Все использованные источники перечислены в списке литературы.
- ✅ Выводы по главам отвечают на вопросы, поставленные во введении.
FAQ
Сложно ли реализовать транскрибатор для диплома?
Зависит от уровня подготовки. Если вы работаете с Python впервые, возьмите готовую библиотеку Vosk или Faster-Whisper. Распознавание запускается в 15—20 строк кода. Сложность в том, чтобы сделать из этого сервис: добавить веб-интерфейс, обработку ошибок и тесты. Для ВКР достаточно MVP, зато у вас будет реальный работающий код.
Требуют ли на защите наличие кода?
Обычно достаточно демонстрации интерфейса и диаграмм. Но если тема связана с разработкой, комиссия может попросить показать структуру проекта и фрагменты реализации. Лучше подготовить 2—3 ключевых файла (главный модуль распознавания, схема БД, API-эндпоинт).
Как оформить UML-диаграммы так, чтобы их приняли?
Диаграмма компонентов должна отображать связи между модулями. Диаграмма классов — для моделей данных. Подписывайте каждый элемент, используйте цветовое кодирование. В пояснительной записке обязательно сделайте ссылку на рисунок: «На рисунке 5. представлена схема...».
Где брать тестовые аудиозаписи для замеров?
Можно записать собственные голосовые заметки, но лучше взять открытые датасеты: Common Voice, LibriSpeech. Для русской речи подойдёт SOVA dataset. Обязательно укажите источник данных в методике.
Чему вы научитесь в процессе работы
- Проектировать системную архитектуру — выделите компоненты, очереди, БД и роли;
- Оценивать качество ИИ-моделей — замерять WER, понимать, откуда берутся ошибки;
- Обосновывать выбор стека — сравнить проприетарный SaaS и open-source;
- Писать техническую документацию — ТЗ, пояснительная записка, руководство пользователя;
- Работать с DevOps-инструментами — Docker, Kubernetes, CI/CD, если решите добавить деплой.
Практические выводы
Кейс «МойОфис» удобен в качестве «точки старта» для ВКР. В нём есть тайминг («за секунды»), формат («структурированный текст выбранного формата») и импортозамещение. Всё это — готовые критерии для вашей работы. Не стремитесь повторять коммерческое решение полностью: возьмите одну задачу, например, преобразование врачебных аудиозаметок в протокол осмотра, и доведите её до прототипа.
Вы научитесь главному — переводить расплывчатую идею «сделать ИИ» в инженерную спецификацию: метрики, диаграммы, сравнение, тесты. Именно этого ждут комиссия и будущий работодатель.
Вывод по использованию статьи в списке литературы
Включите исходный материал в список источников как: «МойОфис» представляет ИИ-решение для преобразования за секунды устной речи в структурированный текст выбранного формата // CNews.ru. — 18.03.2026. Такая ссылка показывает, что ваш диплом опирается на отраслевые публикации текущего года.
Не уверены, с чего начать? Напишите нам — бесплатно разберём вашу тему и предложим план работы. Обычно на согласование структуры и целей уходит не более двух часов. Поможем с любой технической дисциплиной: от информационных систем до прикладной разработки. Разберём даже сложную ВКР на заказ — с готовой архитектурой, расчётами и защитной презентацией.
Источник: «МойОфис» представляет ИИ-решение для преобразования за секунды устной речи в структурированный текст выбранного формата (опубликовано 18.03.2026).