W monografii AI w bibliotekach: stan obecny, perspektywy, wyzwania pod redakcją dr hab. Magdaleny Wójcik, prof. UJ, opublikowałem rozdział o agentach AI i Model Context Protocol w repozytoriach naukowych bibliotek akademickich. Sam rozdział wprost przyznaje swoje ograniczenie: opiera się na przeglądzie literatury i modelowaniu scenariuszy, bo w momencie pisania nie było jeszcze pełnych wdrożeń autonomicznych agentów w polskich repozytoriach do zbadania empirycznie. Od publikacji prowadzę wywiady pogłębione z pracownikami bibliotek akademickich w Polsce, materiał do pracy magisterskiej, i pierwsze rozmowy pokazują coś, czego sama literatura nie wychwyciła: to, co dziś realnie dzieje się z AI w polskich bibliotekach, dzieje się w katalogu, nie w repozytorium.
Katalog biblioteczny i repozytorium naukowe to dwa różne systemy, z różnymi standardami metadanych i różnymi zespołami za nimi stojącymi. Katalog opisuje zbiory fizyczne i elektroniczne biblioteki w formacie MARC21, zwykle w systemie klasy ILS (integrated library system) jak Ex Libris Alma. Repozytorium instytucjonalne gromadzi dorobek naukowy uczelni, zwykle w Dublin Core, w systemach jak dLibra czy DSpace, i rozmawia z resztą świata przez OAI-PMH. To rozróżnienie nie jest formalnością: praca katalogera przy rekordzie MARC21 i praca osoby zarządzającej repozytorium przy zgłoszeniu publikacji to dwa różne zawody w tej samej bibliotece.
Dwa świeże materiały z polskich bibliotek pokazują, gdzie faktycznie ląduje dziś AI. Leszek Szafrański z Biblioteki Jagiellońskiej opisuje w studium przypadku BJ asystenta katalogowania AI wbudowanego w Almę: dostępny od lutego 2025 r., oparty na modelu GPT-4o, bez połączenia z internetem, generuje szkic rekordu MARC21 na podstawie zdjęcia lub tekstu podanego przez katalogera. Agnieszka Dwornik i Daria Fabisiak z Biblioteki Uniwersyteckiej w Toruniu testowały ten sam moduł Almy równolegle z ogólnymi asystentami (Perplexity, ChatGPT, Copilot, Grok, Claude Sonnet, Gemini) w prezentacji o automatyzacji katalogowania, sprawdzając, czy AI poradzi sobie z przypisywaniem deskryptorów Biblioteki Narodowej. Oba zespoły testują AI przy tym samym zadaniu, katalogowaniu w Almie, w tym samym momencie, niezależnie od siebie. Żadna z tych prac nie dotyczy repozytorium.
Połączenie asystenta Almy z bazą Deskryptorów Biblioteki Narodowej zapowiadane jest dopiero na pierwszą połowę 2026 r. Do tego czasu narzędzie generuje rekordy wyłącznie po angielsku, na podstawie danych treningowych ze strefy wspólnej Alma Community Zone, bez dostępu do zewnętrznych źródeł. To wciąż praca nad katalogiem, nawet jeśli dotyczy tej samej biblioteki, która ma też repozytorium.
Po stronie repozytoriów dzieje się coś innego i na innym poziomie: FBC.AI, cyfrowa dostępność i ponowne wykorzystanie zasobów nauki wspierane sztuczną inteligencją, projekt informatyczny opiniowany przez Komitet do spraw Cyfryzacji, z terminem uwag do 15 czerwca 2026 r. Beneficjentem jest Instytut Chemii Bioorganicznej PAN wspólnie z Poznańskim Centrum Superkomputerowo-Sieciowym, wnioskodawcą Ministerstwo Nauki i Szkolnictwa Wyższego. PCSS rozwija od 1999 r. dLibra, system, na którym działa spora część polskich bibliotek cyfrowych i repozytoriów zrzeszonych w Federacji Bibliotek Cyfrowych, więc FBC.AI to projekt AI adresowany wprost do repozytoriów, a nie do katalogów. Obok instytucji publicznych w tę samą przestrzeń wchodzą firmy prywatne obsługujące polskie biblioteki akademickie: PCG Academia prowadzi konferencje branżowe poświęcone wprost temu tematowi, w tym Cyfryzacja zbiorów bibliotecznych: stan i perspektywy z sekcją o narzędziach SI usprawniających pracę bibliotek. To wciąż wczesny etap, konferencje i projekty w fazie opiniowania, nie gotowe wdrożenia z wynikami do zmierzenia, ale jest to ruch po stronie repozytoriów, którego brakowało w materiale, jaki miałem do dyspozycji rok temu.
Wywiady pogłębione, które sam prowadzę, są na podobnie wczesnym etapie i nie są jeszcze gotowe do publikacji jako pełne wyniki, ale jeden wątek wart jest odnotowania już teraz. Z rozmowy z osobą pracującą w bibliotece Śląskiego Uniwersytetu Medycznego wynika, że biblioteka korzysta z płatnej subskrypcji ChatGPT Business między innymi do gromadzenia, wyszukiwania i archiwizowania bieżącego dorobku naukowego pracowników uczelni z wielu baz naukowych oraz do wsparcia codziennej pracy przy Polskiej Platformie Medycznej, repozytorium instytucjonalnym ŚUM. To pierwsze zgłoszone mi wdrożenie ogólnego narzędzia AI bezpośrednio przy pracy repozytoryjnej, nie katalogowej, i traktuję je jako wstępne ustalenie z pojedynczego wywiadu, nie jako reprezentatywny obraz sektora.
Żadne z tych wdrożeń nie jest przy tym bezkosztowe ani bezobsługowe. Dwornik i Fabisiak formułują to wprost po testach: żadne z testowanych narzędzi nie jest w pełni samodzielne, każde wymaga nadzoru kompetentnego bibliotekarza dziedzinowego, bo model językowy może wygenerować rekord poprawny technicznie i błędny merytorycznie, na przykład przypisując książkę do złej dziedziny. Zwracają też uwagę na pytania, których żaden dostawca narzędzia nie odpowie za bibliotekę: ile energii i chłodzenia wymagają serwery, na których te modele działają, na jakich danych je trenowano i za czyją zgodą, jak długo ceny dostępu utrzymają się na obecnym poziomie.
Do tego dochodzi RODO, w praktyce bardziej dotkliwe niż w teoretycznym scenariuszu. Biblioteka, która wysyła skany kart katalogowych albo listę publikacji pracownika do zewnętrznego API, przekazuje dane, które mogą zawierać informacje osobowe, poza infrastrukturę uczelni. Wdrożony w lutym 2025 r. asystent Almy częściowo to rozwiązuje, bo działa bez połączenia z zewnętrznymi bazami, ale ogólne chatboty testowane równolegle w Toruniu takiej gwarancji nie dają.
Wywiady pogłębione, które prowadzę do pracy magisterskiej, wciąż trwają. Jeśli pracujesz w bibliotece akademickiej w Polsce i wdrażasz, testujesz albo odrzucasz narzędzia AI, w katalogu, w repozytorium albo gdziekolwiek indziej, chętnie porozmawiam, napisz na artur@sendyka.dev. Kolejna wersja tego tekstu, z pełnym zestawem wywiadów, powstanie razem z pracą magisterską.