Praktyczne uczenie maszynowe · Otwarta nauka · Nowoczesne technologie

Tworzymy modele językowe i systemy AI, które po prostu działają.

Łączymy badania nad NLP z solidną inżynierią oprogramowania. Rozwijamy modele dla języka polskiego, budujemy narzędzia open source i dzielimy się wiedzą.

O nas

Od badań i eksperymentów po produkcję

Rozwiązujemy konkretne wyzwania technologiczne przy użyciu uczenia maszynowego. Przechodzimy całą drogę: od zebrania i oczyszczenia danych, przez dobór architektury i trenowanie modeli, aż po stabilne wdrożenie w środowisku produkcyjnym. Gdy brakuje gotowych narzędzi, po prostu projektujemy je i budujemy od podstaw.

Szczególne miejsce w naszej pracy zajmuje język polski. Złożona gramatyka, bogata fleksja i mniejsza liczba gotowych zasobów sprawiają, że nie wystarczy zwykłe odpytanie zewnętrznego API — potrzebne jest głębokie zrozumienie metod i tego, jak modele działają pod maską.

Kładziemy nacisk na suwerenność technologiczną i wdrożenia on-premise, a po lokalnym przygotowaniu modeli i zależności — także w środowiskach air-gapped. Lokalne przetwarzanie i maskowanie danych wspierają realizację wymagań RODO / GDPR i europejskiego AI Act bez konieczności wysyłania treści do zewnętrznych API. Zgodność całego wdrożenia zależy również od jego konfiguracji, zastosowania i procedur organizacji — samo narzędzie jej nie gwarantuje.

Nasze rozwiązania

Narzędzia i systemy gotowe do użycia

LLM Router

Wydajna brama AI (AI Gateway) open-source integrująca silniki lokalne z API chmurowymi. Zapewnia routing zapytań, ochronę danych i równoważenie obciążenia.

Szczegóły i specyfikacja

Radar Informacji

Automatyczne wykrywanie tematów i monitorowanie trendów w strumieniach tekstów z wykorzystaniem dopasowania semantycznego oraz klastrowania źródeł.

Szczegóły i algorytm

PII Masker

Skuteczna anonimizacja danych osobowych i poufnych informacji w tekście przed przekazaniem ich do zewnętrznych modeli językowych.

Szczegóły i architektura

RDL Playground AI

Poletko doświadczalne AI: strumień podsumowań wiadomości, artykuły tworzone na podstawie pytań i dzienne przeglądy informacji. Działa lokalnie, bez zakładania konta.

Szczegóły i moduły

Stos technologiczny

Fundament technologiczny naszych systemów

Łączymy modele językowe, wyszukiwanie semantyczne i narzędzia ochrony danych. Ten stos pozwala nam rozwijać własne rozwiązania — od lokalnej analizy wiadomości po zarządzanie ruchem między modelami.

PyTorch trening i dostrajanie modeli
Transformers modele językowe i klasyfikatory
Sentence-Transformers wektorowe reprezentacje tekstu
vLLM wnioskowanie modeli językowych
Ollama lokalne uruchamianie modeli
Milvus baza wektorowa i wyszukiwanie semantyczne
Redis koordynacja ruchu i limity zapytań
ONNX wnioskowanie modeli NER na CPU

Modele i trenowanie

Rozwijamy autorskie modele dla języka polskiego: generatywne pLLama, enkodery semantyczne, ekstrakcyjne QA oraz klasyfikatory NER. Korzystamy z PyTorch i ekosystemu Hugging Face, optymalizując je do wydajnego działania także na lokalnym sprzęcie (RDL Playground AI).

Wnioskowanie i routing LLM

Architektura bramy LLM Router łączy silniki lokalne (vLLM, Ollama) z chmurą przez API OpenAI/Anthropic. Obsługuje konfigurowalne potoki wtyczek, zaawansowane strategie równoważenia obciążenia i koordynację w Redis, gwarantując pełną kontrolę on-premise.

Wyszukiwanie i analiza informacji

Silnik analityczny Radaru Informacji: wyszukiwanie semantyczne w Milvusie, ekstrakcja gęstych wektorów, nieliniowa redukcja wymiarowości (t-SNE/UMAP) oraz dynamiczne klastrowanie HDBSCAN do bezkategoryzacyjnego wykrywania trendów w strumieniach wiadomości.

Anonimizacja i ochrona danych

Fundament systemu PII Masker: dwuwarstwowa ochrona danych osobowych (deterministyczny FastMasker z sumami kontrolnymi + model RoBERTa NER). Kwantyzacja ONNX INT8 umożliwia maskowanie na CPU, wspierając minimalizację danych w projektach objętych RODO/GDPR i AI Act.

Open source i zasoby

Kod, modele i wiedza, którymi się dzielimy

Wierzymy, że otwartość i transparentność przyspieszają rozwój AI. Udostępniamy nasze biblioteki, wagi wytrenowanych modeli, zbiory danych oraz wnioski z eksperymentów dla całej społeczności.

GitHub

Repozytoria narzędzi, routerów i bibliotek programistycznych. Otwarty kod gotowy do uruchomienia i wdrożenia.

radlab-dev-group

Modele językowe

Dostrojone do języka polskiego modele z rodziny pLLama (1B, 3B, 8B, 70B), enkodery semantyczne i modele QA.

huggingface.co/radlab

Zbiory danych

Opracowane i oczyszczone zbiory tekstowe dla języka polskiego, m.in. polish-sts, legal-mc4-pl i korpusy tematyczne.

zbiory danych

Blog inżynierski

Rzetelne wnioski z eksperymentów, optymalizacji i trenowania modeli. Piszemy o tym, co działa i jak rozwiązujemy realne problemy.

czytaj na blogu

Kontakt i współpraca

Masz pytania lub pomysł na wspólny projekt?

Napisz do nas. Chętnie pomożemy wdrożyć rozwiązania AI w Twojej organizacji, skonsultujemy architekturę lub podyskutujemy o niuansach przetwarzania języka polskiego.

  • Architektura AI Gateway i optymalizacja kosztów — Wdrożenia bramy LLM Router, pooling silników vLLM / Ollama, zaawansowane strategie równoważenia obciążenia i redukcja kosztów API.
  • Dostrajanie i ewaluacja modeli dla języka polskiego — Fine-tuning polskich modeli językowych, ewaluacja na dziedzinowych benchmarkach i kwantyzacja pod kątem lokalnej infrastruktury.
  • Bazy wiedzy, RAG on-premise i ochrona prywatności — Bezpieczne systemy RAG w środowiskach on-premise, integracja wektorowa z Milvus oraz maskowanie wrażliwych danych PII.

Blog

Ostatnio na blogu

Wszystkie wpisy