18+
реклама
18+
Бургер менюБургер меню

Роман Косов – Методические указания: интеграция искусственного интеллекта в деятельность государственного служащего (страница 8)

18

Стратегическая цель, озвученная на уровне правительства, амбициозна: к 2030 году на платформе «ГосТех» должно быть реализовано около ста услуг , а сама платформа должна стать основной точкой распространения ИИ-инструментов в государственном управлении. Это означает, что чиновник, который сегодня начинает осваивать логику работы с «ГосТех» и встроенными в него ИИ-сервисами, инвестирует в свою профессиональную конкурентоспособность на годы вперёд. Тот же, кто продолжает игнорировать платформу в надежде, что «и так сойдёт», рискует оказаться в положении бухгалтера, который в середине девяностых отказался переходить с деревянных счётов на Excel.

Часть II. Инструментарий современного служащего: Эффект «второго пилота»

Глава 4. Нейросети как универсальный офисный пакет

4.1. Текстовые генеративные модели: сравнительный анализ для госзадач

В профессиональной среде государственных служащих принято с осторожностью относиться к хайповым технологиям, и это здоровая реакция. Когда очередной подрядчик или энтузиаст из ИТ-отдела начинает рассказывать про «революционные нейросети, которые напишут за вас любой документ», опытный чиновник обычно задаёт два вопроса: насколько это безопасно и насколько это вообще применимо к реальной работе, а не к абстрактным тестовым заданиям. Попробуем ответить на оба вопроса предметно, без рекламной шелухи.

На момент написания этой книги на российском рынке присутствуют три основные большие языковые модели, которые имеет смысл рассматривать для государственных задач: YandexGPT (семейство моделей от Яндекса, включая облегчённые версии), GigaChat (разработка Сбера) и различные сборки на основе международных open-source моделей, которые могут быть развёрнуты в защищённом контуре. Отдельно стоит упомянуть публичные зарубежные сервисы вроде ChatGPT от OpenAI, но их использование в государственной деятельности сопряжено с такими рисками, что рекомендовать их можно только для сугубо личных, не связанных со службой задач. Остановимся на отечественных решениях, которые могут использоваться без нарушения требований к размещению данных.

YandexGPT и GigaChat, при всём внешнем сходстве — это не два одинаковых продукта с разными логотипами, а две разные философии построения моделей. YandexGPT исторически развивалась в экосистеме поисковых и пользовательских сервисов: она хорошо умеет работать с фактологическими запросами, искать информацию, суммаризировать большие объёмы текста и держать контекст длинных бесед. GigaChat изначально проектировался с прицелом на корпоративный и государственный сектор: упор делался на безопасность, возможность тонкой настройки под конкретные задачи, работу с русскоязычной юридической и технической документацией. Разница примерно как между универсальным внедорожником и бронированным инкассаторским автомобилем: первый удобнее в повседневной езде, второй — специализирован для конкретных задач с повышенными требованиями к защите.

Для типовых задач госслужащего — написание проектов ответов, суммаризация длинных документов, поиск по нормативной базе, проверка грамматики и стиля — обе модели показывают сопоставимые результаты, и выбор между ними часто определяется не столько качеством выдачи, сколько инфраструктурными соображениями: какая платформа развёрнута в контуре ведомства, какая интеграция с существующими системами документооборота проще реализуется, какие условия предлагает вендор по сопровождению.

Принципиально важно понимать: ни одну из этих моделей нельзя использовать как «чёрный ящик», которому доверяют написание окончательного текста без проверки. Все они подвержены тем же самым проблемам, что и любые другие большие языковые модели: галлюцинации (выдумывание несуществующих фактов, нормативных актов, цифр), контекстные ошибки (когда модель «забывает», о чём шла речь в начале длинного документа), неверная интерпретация сложных юридических конструкций. Поэтому правильная метафора для использования LLM в госслужбе — это не «робот-писатель», а «стажёр с феноменальной скоростью печати, но полным отсутствием понимания реальности». Такой стажёр может за минуту набросать черновик, на который у вас ушёл бы час, но проверять каждую запятую, каждую ссылку на закон и каждую цифру всё равно придётся вам. Экономия времени получается не за счёт исключения человеческого контроля, а за счёт того, что контролировать готовый черновик быстрее, чем писать его с нуля.

Отдельный сюжет — это вопрос о том, на каких данных обучались эти модели и что они «знают» о специфике государственной службы. Ни YandexGPT, ни GigaChat не обучались на закрытых ведомственных базах, поэтому их знания о внутренних регламентах, типовых формах документов конкретного министерства или региональных особенностях делопроизводства ограничены. Это лечится механизмом RAG (Retrieval-Augmented Generation), о котором мы упоминали в предыдущей главе: модель подключается к ведомственной базе знаний и генерирует ответы на основе конкретных документов, а не на основе «общих знаний», полученных при предобучении. Именно этот механизм превращает общую модель в специализированного помощника, и именно его внедрение является главной задачей ИТ-подразделений ведомств на ближайшие годы.

В практическом плане чиновнику не нужно становиться экспертом по машинному обучению, чтобы эффективно использовать текстовые модели. Достаточно освоить базовые принципы промпт-инжиниринга (этому посвящена следующая глава), понимать сильные и слабые стороны каждой доступной модели и чётко знать, с какими типами документов можно работать в каждой конкретной системе. Если в вашем распоряжении есть только публичный сервис — работаете с открытыми данными и типовыми шаблонами, не содержащими персональной информации. Если есть ведомственный контур с подключённой LLM — спектр задач расширяется, но контроль остаётся не менее строгим.

Подводя итог этому микро-обзору: выбор текстовой модели для госзадач — это не выбор между «хорошей» и «плохой» нейросетью. Это выбор инструмента под конкретную задачу и конкретные условия безопасности. YandexGPT, GigaChat, локальные open-source модели — все они имеют право на существование в арсенале цифрового чиновника, если используются с умом и с пониманием их ограничений. А ограничения эти таковы, что ни одна модель не заменит головы на плечах, но любая из них способна сделать эту голову значительно более производительной.

4.2. Речевые технологии: автоматическая расшифровка совещаний, стенограммы, голосовое заполнение форм

Если текстовые нейросети уже прочно вошли в информационную повестку и обсуждаются на каждом втором совещании по цифровизации, то речевые технологии остаются в тени, и совершенно незаслуженно. Между тем именно они способны дать самый быстрый и осязаемый эффект экономии времени, особенно для руководителей и сотрудников, чья работа связана с большим количеством встреч, планёрок и телефонных переговоров.

Давайте посмотрим правде в глаза: расшифровка совещаний и подготовка протоколов — это одна из самых недооценённых по трудозатратам задач в государственном аппарате. Хороший специалист тратит на расшифровку часовой записи в полтора-два раза больше времени, чем длилась сама запись. Если же запись велась в плохих акустических условиях, если говорили несколько человек с наложением голосов, если спикер использует профессиональный жаргон и аббревиатуры — время расшифровки вырастает в три-четыре раза. При этом сама задача — перевод устной речи в письменный текст — не требует высокой квалификации, она требует только времени и внимания, которые могли бы быть потрачены на что-то более содержательное. Это идеальный кандидат на автоматизацию.

Современные системы автоматического распознавания речи (ASR, Automatic Speech Recognition) достигли такого уровня, что при хорошем качестве записи дают точность выше 90 процентов, а в некоторых сценариях приближаются к 95-97 процентам. Whisper от OpenAI (открытая модель, которую можно развернуть локально), SaluteSpeech от Сбера, решения от Яндекса и других российских разработчиков — выбор достаточно широк, чтобы подобрать инструмент под конкретные требования по безопасности и качеству.

Ключевой вопрос для государственного служащего: можно ли загружать аудиозапись внутреннего совещания в облачный сервис распознавания речи? Ответ зависит от грифа совещания. Если обсуждались вопросы, содержащие служебную информацию ограниченного распространения или персональные данные, использование публичного облачного сервиса исключено. Это тот самый случай, когда либо используется решение, развёрнутое в защищённом контуре ведомства, либо расшифровка по-прежнему делается вручную. Техническая возможность развернуть ASR-систему локально существует: та же модель Whisper может работать на сервере без доступа в интернет, обеспечивая вполне приемлемое качество распознавания русской речи.

Отдельного упоминания заслуживает технология диаризации — разделения аудиозаписи на голоса разных спикеров. Именно эта технология превращает «полотно текста» в полноценный протокол с репликами, приписанными конкретным участникам совещания. Современные ASR-системы всё чаще включают диаризацию в базовый функционал, но качество разделения всё ещё зависит от акустических условий: если участники сидят за одним столом и говорят по очереди в микрофон — всё хорошо. Если это бурное обсуждение в большом кабинете с перебиванием друг друга — качество диаризации падает, и требуется ручная доработка.