Настроить Cookies
Для вашего комфорта и улучшения работы сайта мы используем cookie.
Настроить Cookies
Настройки Cookies
Файлы cookie, необходимые для корректной работы сайта, всегда включены. Другие файлы cookie можно настроить.
Основные файлы cookie
Всегда включены. Эти файлы cookie необходимы для работы веб-сайта и его функций. Их нельзя отключить. Они устанавливаются в ответ на ваши запросы, например, при настройке параметров конфиденциальности, входе в систему или заполнении форм.
Аналитические файлы cookie
Disabled
Эти файлы cookie собирают информацию, которая помогает нам понять, как используются наши веб-сайты, насколько эффективны наши маркетинговые кампании, а также помогает нам персонализировать наши веб-сайты для вас.
Рекламные файлы cookie
Disabled
Эти файлы cookie предоставляют рекламным компаниям информацию о вашей активности в интернете, чтобы помочь им показывать вам более релевантную рекламу или ограничивать количество показов рекламы. Эта информация может быть передана другим рекламным компаниям.
Филигранные парсер-решения тяжёлых задач обработки естественного языка
Тезисы
Для многих задач всё активнее применяются нейросети, вытесняя другие решения. Однако у нейросетей как инструмента есть свои погрешности — дороговизна вычислительных ресурсов, необходимость в качественном большом датасете для обучения, долгий цикл изменений с зачастую нестабильными результатами, высокий latency.

Порой перед нами стоят задачи на высокоскоростную работу с большим потоком семантически и грамматически обогащённых данных. Как в моем случае, выделение структурированных NER-сущностей с возможностью корректирования правил их построения. И здесь на помощь приходят старые добрые парсеры грамматик. Благодаря наличию структуры у сущностей Rust и его trait-ы и дженерики отлично сочетаются с мета-правилами двухуровневых грамматик и помогают создавать лаконичное и высокопроизводительное решение.

И даже больше, такая система может быть не только самостоятельным обработчиком, но и стать дополнительным слоем постобработки для небольшой нейромодели, сокращая погрешности. На небольшом количестве параметров можно выделить границы общей сущности, а данному парсеру остаётся лишь сосредоточиться на филигранной обработке подсущностей.
Для многих задач всё активнее применяются нейросети, вытесняя другие решения. Однако у нейросетей как инструмента есть свои погрешности — дороговизна вычислительных ресурсов, необходимость в качественном большом датасете для обучения, долгий цикл изменений с зачастую нестабильными результатами, высокий latency.

Порой перед нами стоят задачи на высокоскоростную работу с большим потоком семантически и грамматически обогащённых данных. Как в моем случае, выделение структурированных NER-сущностей с возможностью корректирования правил их построения. И здесь на помощь приходят старые добрые парсеры грамматик. Благодаря наличию структуры у сущностей Rust и его trait-ы и дженерики отлично сочетаются с мета-правилами двухуровневых грамматик и помогают создавать лаконичное и высокопроизводительное решение.

И даже больше, такая система может быть не только самостоятельным обработчиком, но и стать дополнительным слоем постобработки для небольшой нейромодели, сокращая погрешности. На небольшом количестве параметров можно выделить границы общей сущности, а данному парсеру остаётся лишь сосредоточиться на филигранной обработке подсущностей.
Информация о спикере
Елизавета Косарева
Rust-разработчик
Несколько лет работаю в сфере аналитики данных, существую на стыке живых и компьютерных языков, люблю оптимизацию для высоконагруженных систем
  • Елизавета Косарева
    Rust-разработчик
    Несколько лет работаю в сфере аналитики данных, существую на стыке живых и компьютерных языков, люблю оптимизацию для высоконагруженных систем
Все доклады