Guardrail-классификатор небезопасного контента: 15 категорий, два языка, $0.06 за миллион запросов
#продуктМы разработали guardrail-классификатор, который проверяет входящие запросы пользователей и ответы языковой модели по 15 категориям риска — до того, как контент дойдёт до пользователя или до основной модели. Модель работает на русском и английском, устойчива к обходу фильтров и стоит $0.062 за миллион запросов на одной видеокарте. Рассказываем, как она устроена, как показала себя против 9 открытых решений и где ошибается.