Обязанности:
- Оценка и ранжирование ответов LLM на основе чётких критериев качества (полезность, безопасность, точность, полнота)
- Написание и редактирование промптов для сбора данных обратной связи (preference data)
- Формирование и разметка датасетов для обучения моделей (preference datasets, safety datasets)
- Участие в разработке гайдлайнов и инструкций для оценки ответов модели
- Анализ ошибок модели и подготовка рекомендаций для инженеров по доработке
- Взаимодействие с командой разработки, лингвистами и продуктовыми менеджерами
- Участие в A/B-тестировании промптов и системных инструкций
Требования:
- Опыт: работы с LLM или в области NLP от 1 года (или сильное предметное знание в конкретном домене: HR, инженерия, химия, биология, право, медицина)
- Высшее образование (или глубокие знания) в своей предметной области
- Способность формализовать экспертный опыт в понятные модели инструкции и критерии оценки
- Понимание принципов работы LLM и метрик качества (BLEU, ROUGE, полезность, безопасность)
- Навыки написания чётких и структурированных текстов (документация, инструкции, промпты)
- Английский: уровень не ниже Intermediate (работа с зарубежными датасетами и документацией)
- Личные качества: критическое мышление, внимательность к деталям, способность к систематизации знаний
Часто задаваемые вопросы:
Чем AI-тренер отличается от Prompt Engineer?
Ответ: Prompt Engineer разрабатывает промпты для получения нужных ответов от модели. AI-тренер оценивает эти ответы, ранжирует их и помогает модели учиться на человеческой обратной связи (RLHF). Это более широкая роль, связанная с обучением модели, а не только с инженерией запросов.
Какие профили подходят для AI-тренера?
Ответ: Эксперты в конкретных доменах: HR, юристы, инженеры, химики, биологи, врачи, педагоги. Важно не просто знать предмет, но и уметь формализовать свои знания в инструкции и критерии оценки.
Какие задачи решает AI-тренер в RLHF?
Ответ: Сбор и разметка данных для обучения модели (preference data), оценка ответов модели по шкале (полезность, безопасность), написание гайдлайнов для других оценщиков, анализ ошибок модели и подготовка рекомендаций для инженеров.
Что такое RLHF простыми словами?
Ответ: RLHF (Reinforcement Learning from Human Feedback) — это метод, при котором модель сначала учится на большом количестве текстов, а затем её дообучают на основе оценок людей. Люди ранжируют ответы модели по качеству, и модель учится выдавать ответы, которые люди считают лучшими.




