AtesiT-Company
AI & ML interests
None defined yet.
Recent Activity
⚡ AtesiT
NLP · AI · Open Source
💭 Философия
«Качественный open-source датасет — это фундамент, на котором строятся тысячи моделей.
Моя цель — создавать такие фундаменты для русскоязычного ML-сообщества.»
🎯 Создаю полезные open-source решения: датасеты, модели, пайплайны.
🛠️ От подготовки данных до production-ready инференса.
🌍 Фокус — русский язык и реальные бизнес-задачи.
👤 Навыки
🧠 LLM & Генерация
- Zero-shot и Few-shot промпты
- Настройка температуры, Top‑p, Repetition Penalty
- Жадное декодирование и Beam Search
- Стриминг и асинхронные запросы
- Оценка стоимости запросов (токены → $)
🤖 Агенты & Инструменты
- ReAct-агенты с инструментами (LangChain)
- Tool Calling / Function Calling
- Мультиагентные системы (LangGraph)
- Human-in-the-loop (паузы, подтверждения)
🔍 RAG-системы
- Поиск: BM25, семантика (BGE-M3), гибрид (RRF)
- Переранжирование (Cross-Encoder)
- FAISS для быстрого поиска
- Генерация ответа через LLM (Qwen2.5)
⚡ Оптимизация & Оценка
- Квантизация (INT8, динамическая)
- Замеры TTFT, скорости генерации
- GPU vs CPU бенчмарки
- Сравнение моделей по качеству и скорости
📊 Работа с данными
- Очистка, дедупликация (хеш, MinHash, семантика)
- Синтетическая генерация (Self-Instruct)
- Гибридная разметка (LLM + человек)
- Форматирование SFT (ChatML)
🎯 Дообучение
- Fine‑tuning энкодеров (Triplet Loss, Multi‑Task)
- Дообучение декодеров на SFT‑датасетах
- Early Stopping, pos_weight для дисбаланса
🔥 Проекты
🌐 Доменная адаптация энкодера
Англоязычный all-MiniLM-L6-v2 адаптирован под русский язык через Triplet Loss на парафразах.
⚡ Квантизация BGE-M3 → INT8
Сжатие модели на 40% (2182 МБ → 1299 МБ) с падением Recall@5 менее 1%.
🧠 Multi‑Task классификатор токсичности
Одна модель — три головы: мат · угрозы · незаконное. Индивидуальный подбор порогов для редких классов.
🛡️ Бинарный классификатор токсичности
Transfer learning на ru-en-RoSBERTa для контроля качества сообщений техподдержки. Accuracy 96.7%.
🛡️ Датасет для классификации токсичности в техподдержке
Сбалансированный датасет для бинарной классификации сообщений техподдержки.
🧠 Multi‑label датасет токсичности
Датасет с тремя независимыми метками: мат, угрозы, запросы про незаконное.
🏥 Датасет для SFT медицинской маршрутизации
Датасет для обучения модели классификации жалоб пациентов по специализации врача. Размечен гибридной схемой (LLM + человек).
🎬 Демо‑датасет для техподдержки «КиноПоток»
Небольшой демо-датасет для бинарной классификации в онлайн-кинотеатре (учебный проект).
MIT License · Built with ❤️