Reasoning & RL
Учим модели рассуждать и действовать: синтетические датасеты для reasoning и собственные реализации алгоритмов обучения с подкреплением (GRPO, multiturn, tool calling).
researchim — независимая исследовательская группа с фокусом на обучении с подкреплением (RL). Мы учим модели принимать решения, рассуждать и действовать — и превращаем это в открытые инструменты.
researchim — это исследования и открытые инструменты вокруг всего стека современного ИИ: от обучения моделей рассуждать и действовать до симуляторов физического мира, локальных агентов и прикладных проектов в индустрии.
Учим модели рассуждать и действовать: синтетические датасеты для reasoning и собственные реализации алгоритмов обучения с подкреплением (GRPO, multiturn, tool calling).
Строим удобную визуальную студию, чтобы каждый мог тренировать свои модели дома — от pretrain и SFT до GRPO — в едином интерфейсе.
Полностью локальные кодинг- и research-агенты на базе Qwen: приватность, deep research и автоматизация без облака.
Пишем симуляторы физического мира — нефтяной пласт, квантовый компьютер, атомный реактор — как среды для экспериментов с LLM и RL.
Переносим методы ИИ в реальные индустрии: оптимизация добычи нефти с помощью LLM и распознавание документов через тюнинг VLM-моделей.
Собираем базу знаний по ИИ и его применению в отраслях, а также туторы и инструкции для быстрого входа в область.
Читаем свежие статьи, воспроизводим результаты и проверяем гипотезы на практике.
Строим минимальные, но рабочие прототипы алгоритмов RL и reasoning для LLM.
Публикуем понятные open-source библиотеки, чтобы результатами могли пользоваться все.
Обсуждаем идеи и находки в сообществе — учимся вместе.
Мы — про обучение с подкреплением, так что вот живой пример прямо в браузере. Настоящий табличный Q-learning в гридворлде: агент методом проб и ошибок учится доходить до награды +1 и обходить штрафы −1. Обучите его — или пройдите поле сами.
Нажмите «Обучить агента» — и смотрите, как растёт награда, а по клеткам проявляется выученная политика. Или играйте сами: стрелки / WASD.
Открытые проекты, которые мы разрабатываем и поддерживаем — от обучения моделей и агентов до симуляторов и прикладного ИИ.
Визуальная студия, чтобы удобно обучать модели прямо у себя дома — единая точка входа как для новичков, так и для тех, кто уже тренирует модели разных размеров. Сейчас: LLM (pretrain / SFT / GRPO), в планах — DL-модели по многим направлениям.
GitHub репозиторий →Собственная имплементация GRPO на базе проекта tiny-grpo: добавлены примеры с использованием инструментов и multiturn GRPO. В планах — навести порядок и завести улучшения из статьи Dr. GRPO.
GitHub репозиторий →Генерация синтетических датасетов для reasoning: логические и математические задачки для обучения моделей рассуждать. Направление с огромным пространством для развития.
GitHub репозиторий →Полностью локальный кодинговый агент на базе моделей Qwen — помощник-программист, который работает целиком на вашей машине, без облака.
GitHub репозиторий →Полностью локальный research-агент на базе Qwen с поддержкой deep research — ищет, читает и анализирует источники прямо на вашей машине.
GitHub репозиторий →Полноценный симулятор нефтедобычи. Уже есть моделирование пласта, нагнетательные (закачка воды) и добывающие скважины. Дальше — связность между скважинами и остальная инфраструктура.
GitHub репозиторий →Симулятор квантовых вычислений с возможностью подключения LLM и RL — среда для экспериментов над квантовыми алгоритмами и обучением агентов.
GitHub репозиторий →Симулятор атомного реактора — среда для моделирования процессов и экспериментов, в том числе как площадка для ИИ-агентов.
GitHub репозиторий →LLM в добыче нефти: моделирование скважин и обучение моделей на данных. Сейчас активно прорабатывается генерация данных для сбора датасетов. В перспективе проект перерастёт в НефтьГПТ.
GitHub репозиторий →Генерация синтетических документов для тюнинга VLM-моделей под задачи распознавания документов.
GitHub репозиторий →База знаний об ИИ по отраслям: где и как применяется искусственный интеллект, большие вводные и учебные материалы по разделам ИИ и ML (в том числе ресёчи).
GitHub репозиторий →Материалы для быстрого старта в ИИ: туторы, инструкции по развёртыванию инструментов и практические гайды для тех, кто только входит в область.
GitHub репозиторий →Обсуждаем ИИ, RL и LLM, делимся статьями, экспериментами и кодом. Открыты для всех, кому интересно исследовать интеллект.