Reinforcement Learning · reasoning · LLM

Учим машины
действовать и рассуждать

researchim — независимая исследовательская группа с фокусом на обучении с подкреплением (RL). Мы учим модели принимать решения, рассуждать и действовать — и превращаем это в открытые инструменты.

0 открытых проектов
RL + reasoning
LLM + tool calling
Open source first
// о нас

Чем мы занимаемся

researchim — это исследования и открытые инструменты вокруг всего стека современного ИИ: от обучения моделей рассуждать и действовать до симуляторов физического мира, локальных агентов и прикладных проектов в индустрии.

Reasoning & RL

Учим модели рассуждать и действовать: синтетические датасеты для reasoning и собственные реализации алгоритмов обучения с подкреплением (GRPO, multiturn, tool calling).

Обучение моделей

Строим удобную визуальную студию, чтобы каждый мог тренировать свои модели дома — от pretrain и SFT до GRPO — в едином интерфейсе.

Локальные агенты

Полностью локальные кодинг- и research-агенты на базе Qwen: приватность, deep research и автоматизация без облака.

Симуляторы мира

Пишем симуляторы физического мира — нефтяной пласт, квантовый компьютер, атомный реактор — как среды для экспериментов с LLM и RL.

Прикладной ИИ

Переносим методы ИИ в реальные индустрии: оптимизация добычи нефти с помощью LLM и распознавание документов через тюнинг VLM-моделей.

Знания и быстрый старт

Собираем базу знаний по ИИ и его применению в отраслях, а также туторы и инструкции для быстрого входа в область.

// подход

Как мы работаем

01

Исследуем

Читаем свежие статьи, воспроизводим результаты и проверяем гипотезы на практике.

02

Экспериментируем

Строим минимальные, но рабочие прототипы алгоритмов RL и reasoning для LLM.

03

Открываем код

Публикуем понятные open-source библиотеки, чтобы результатами могли пользоваться все.

04

Делимся

Обсуждаем идеи и находки в сообществе — учимся вместе.

// reinforcement learning

RL-песочница

Мы — про обучение с подкреплением, так что вот живой пример прямо в браузере. Настоящий табличный Q-learning в гридворлде: агент методом проб и ошибок учится доходить до награды +1 и обходить штрафы −1. Обучите его — или пройдите поле сами.

Агент Награда +1 Штраф −1 Функция ценности + политика
0эпизод
0.00reward / эпизод
лучший reward
1.00ε — исследование

Нажмите «Обучить агента» — и смотрите, как растёт награда, а по клеткам проявляется выученная политика. Или играйте сами: стрелки / WASD.

// open source

Проекты

Открытые проекты, которые мы разрабатываем и поддерживаем — от обучения моделей и агентов до симуляторов и прикладного ИИ.

RL / GRPO

re-grpo

Собственная имплементация GRPO на базе проекта tiny-grpo: добавлены примеры с использованием инструментов и multiturn GRPO. В планах — навести порядок и завести улучшения из статьи Dr. GRPO.

RLGRPOtool calling
GitHub репозиторий →
reasoning

re-rl

Генерация синтетических датасетов для reasoning: логические и математические задачки для обучения моделей рассуждать. Направление с огромным пространством для развития.

RLreasoningdatasets
GitHub репозиторий →
agent

one-click-coding-agent

Полностью локальный кодинговый агент на базе моделей Qwen — помощник-программист, который работает целиком на вашей машине, без облака.

agentscodingQwenlocal
GitHub репозиторий →
agent

one-click-research-agent

Полностью локальный research-агент на базе Qwen с поддержкой deep research — ищет, читает и анализирует источники прямо на вашей машине.

agentsresearchdeep researchQwen
GitHub репозиторий →
simulator

oil-simulator-py

Полноценный симулятор нефтедобычи. Уже есть моделирование пласта, нагнетательные (закачка воды) и добывающие скважины. Дальше — связность между скважинами и остальная инфраструктура.

simulationphysicsoil&gas
GitHub репозиторий →
simulator

quantum-computing-sim-py

Симулятор квантовых вычислений с возможностью подключения LLM и RL — среда для экспериментов над квантовыми алгоритмами и обучением агентов.

quantumsimulationLLM / RL
GitHub репозиторий →
simulator

atomic-sim

Симулятор атомного реактора — среда для моделирования процессов и экспериментов, в том числе как площадка для ИИ-агентов.

simulationphysicsnuclear
GitHub репозиторий →
НефтьГПТ

re-oil-production-llm

LLM в добыче нефти: моделирование скважин и обучение моделей на данных. Сейчас активно прорабатывается генерация данных для сбора датасетов. В перспективе проект перерастёт в НефтьГПТ.

LLMoil&gasdatasets
GitHub репозиторий →
VLM

re-synthetic-docs

Генерация синтетических документов для тюнинга VLM-моделей под задачи распознавания документов.

VLMsynthetic dataOCR
GitHub репозиторий →
knowledge

state-of-ai

База знаний об ИИ по отраслям: где и как применяется искусственный интеллект, большие вводные и учебные материалы по разделам ИИ и ML (в том числе ресёчи).

knowledgeindustryeducation
GitHub репозиторий →
guides

fast-start-ai

Материалы для быстрого старта в ИИ: туторы, инструкции по развёртыванию инструментов и практические гайды для тех, кто только входит в область.

educationtutorialsguides
GitHub репозиторий →
// сообщество

Присоединяйтесь к researchim

Обсуждаем ИИ, RL и LLM, делимся статьями, экспериментами и кодом. Открыты для всех, кому интересно исследовать интеллект.