SGKP-Search
Wyszukiwanie, konwersacja i przeglądanie haseł Słownika Geograficznego
Aplikacja w wersji beta. Zawiera automatycznie przetworzony tekst SGKP. Treść haseł i metadane mogą zawierać literówki i błędy, które są aktualnie weryfikowane i poprawiane. Odpowiedzi generowane przez modele językowe należy sprawdzać w przywołanych hasłach i skanach stron.
SGKP-Search udostępnia tekst Słownika geograficznego Królestwa Polskiego i innych krajów słowiańskich, wraz z tomem uzupełniającym, oraz informacje wydobyte z haseł w postaci metadanych. Umożliwia odnajdywanie nazw i tematów, zadawanie pytań o treść słownika oraz przeglądanie i filtrowanie haseł.
Aplikacja powstała w Pracowni Historii Cyfrowej Instytutu Historii Polskiej Akademii Nauk w ramach projektu Geografia kulturowo-intelektualna dawnych ziem polskich pod zaborami 1865–1918 – cyfrowe vademecum.
Trzy sposoby korzystania ze słownika
- Wyszukiwanie — odnajdywanie haseł według nazw, słów lub tematyki.
- Konwersacja — pytania w języku naturalnym i odpowiedzi opracowywane na podstawie fragmentów słownika, z odsyłaczami do źródeł.
- Przeglądanie — uporządkowana lista haseł, którą można zawężać filtrami.
Interfejs jest dostępny po polsku i angielsku. Przełączniki w nagłówku pozwalają zmienić język oraz wybrać jasny lub ciemny motyw. Okno "Pomoc" zawiera podstawowe wskazówki użytkowania.
Wyszukiwanie
Wpisz nazwę, wyrażenie lub pojęcie, a następnie wybierz jeden z trzech trybów:
- Pełnotekstowe — wyszukuje słowa w treści haseł. Jest przydatne przy szukaniu nazw miejscowości, osób i konkretnych terminów i pojęć. Wyszukiwanie dopuszcza pewną tolerancję dopasowania wyrazów, co pozwala odszukać warianty nazwy czy też nazwy z literówkami np. w wyniku OCR.
- Hybrydowe — łączy wyszukiwanie słów z podobieństwem znaczeniowym. Suwak "Udział semantyki" określa proporcję obu metod.
- Semantyczne — odnajduje fragmenty zbliżone znaczeniowo do zapytania. Warto wpisywać określenia tematyki, np. "wydobywanie surowców" lub "mielenie ziarna". Wyniki mogą dotyczyć szukanego tematu, mimo że nie zawierają dokładnie użytych słów.
W trybie semantycznym można włączyć "Dodatkową weryfikację wyników". Model decyzyjny porównuje wówczas zapytanie ze znalezionym fragmentem hasła i odrzuca wyniki ocenione jako niezwiązane z tematem. Trzeba pamiętać, że taka weryfikacja wydłuża wyszukiwanie i również może popełniać błędy.
Wyniki są prezentowane według trafności, zwykle po 20 na stronie. Każda karta zawiera nazwę, podstawowe informacje o haśle, fragment tekstu oraz odsyłacz do skanu. Wyszukiwanie semantyczne wskazuje podobieństwo tematyczne; nie gwarantuje pełnego zestawienia wszystkich haseł dotyczących danego zagadnienia.
Filtry i metadane
W każdej zakładce po lewej stronie dostępny jest zwijany panel filtrów. Można wybrać tom, powiat i zakres haseł: wszystkie hasła, tylko miejscowości albo tylko hasła niebędące miejscowościami.
- Dla miejscowości dostępne są: przynależność do Królestwa Polskiego, typ punktu osadniczego, gubernia, gmina i parafia katolicka. Gminę i parafię wybiera się z listy po wpisaniu fragmentu nazwy.
- Dla innych haseł można wybrać typ, np. rzekę, jezioro lub górę. Lista typów powstaje na podstawie metadanych źródłowych.
- Filtry w sekcji "Informacje w haśle" wymagają obecności adnotacji w wybranych kategoriach. Zaznaczenie kilku kategorii oznacza, że hasło musi zawierać informacje o każdej z nich.
Obecnie dostępnych jest 28 kategorii informacji, zebranych w sześć zwijanych grup:
- Obiekty i dziedzictwo: obiekty sakralne, dwory i pałace, zabytki, znaleziska archeologiczne, ogrody i architektura krajobrazu, nekropolie.
- Gospodarka: zakłady przemysłowe, młyny, rzemiosło, handel, hodowla.
- Transport i łączność: poczta i telegraf, stacje kolejowe, urzędy i obiekty celne, żegluga i przeprawy.
- Urzędy, sądy i wojsko: urzędy, sądy, wojsko.
- Edukacja, zdrowie i dobroczynność: szkoły, opieka zdrowotna, uzdrowiska, dobroczynność, bursy.
- Kultura i książka: biblioteki, kolekcjonerstwo, drukarnie, muzealnictwo, księgarnie.
Brak adnotacji nie oznacza braku obiektu. Filtry korzystają z wydobytych automatycznie metadanych, a nie ze wszystkich wzmianek w treści. Niekompletne lub błędne metadane mogą więc wpływać na wynik.
Konwersacja
W tej zakładce można zadawać pytania o informacje zawarte w słowniku. Aplikacja interpretuje pytanie, wyszukuje fragmenty i przygotowuje odpowiedź z numerowanymi odsyłaczami do wykorzystanych haseł. Kolejne pytanie może nawiązywać do wcześniejszej odpowiedzi. Filtry pozwalają ograniczyć zakres źródeł.
Na ekranie znajduje się dziesięć przykładowych pytań. Link "Więcej przykładów" otwiera pełną listę z podziałem tematycznym i filtrowaniem tekstowym. Wybranie pytania z tego okna wpisuje je do pola Konwersacji, gdzie można je zmienić i ustawić filtry przed wysłaniem.
Przykłady pytań:
- "Co wiadomo o miejscowości Barcząca?"
- "W których miejscowościach znajdowały się huty szkła?"
- "Jakie znaleziska archeologiczne znajdowały się w miejscowościach powiatu warszawskiego?"
- "Ilu robotników pracowało w zakładach Żyrardowa i jakie wyroby tam wytwarzano?"
- "W ilu hasłach pojawiają się informacje o bibliotekach?"
Dwie opcje pozwalają zmienić sposób przygotowania odpowiedzi:
- Dodatkowa weryfikacja wyników — model decyzyjny sprawdza związek wyszukanych fragmentów z pytaniem przed przekazaniem ich do modelu przygotowującego odpowiedź.
- Pogłębiona analiza — włącza tryb rozumowania modelu podczas przygotowywania końcowej odpowiedzi. Może znacznie wydłużyć oczekiwanie; nie oznacza automatycznie większej liczby źródeł ani pełniejszej odpowiedzi.
Przy pytaniach o liczbę haseł zawierających informacje z obsługiwanej kategorii aplikacja może zliczyć adnotowane hasła z uwzględnieniem filtrów. Taki wynik oznacza liczbę haseł z metadanymi, a nie liczbę obiektów, np. bibliotek lub urzędów, ani wszystkich wzmianek o nich w słowniku.
W angielskiej wersji językowej aplikacji można zadawać pytania w języku angielskim, pytanie jest automatycznie tłumaczone na polski na potrzeby wyszukiwania w polskim tekście SGKP, a odpowiedź jest przygotowywana po angielsku. Przetwarzanie jest sygnalizowane komunikatami o kolejnych etapach; przy odpowiedzi wyświetlany jest czas jej przygotowania.
"Pobierz PDF" zapisuje rozmowę wraz ze źródłami. "Wyczyść rozmowę" usuwa bieżącą konwersację z karty przeglądarki.
Przeglądanie
Zakładka pokazuje hasła i pod-hasła, po 50 na stronie. Domyślnie wyświetlany jest tom 1. Można wybrać inny tom lub wszystkie tomy, zawęzić listę nazwą albo fragmentem nazwy oraz korzystać z pozostałych filtrów. Lista odświeża się po każdej zmianie filtrów.
Dostępne są widoki listy i siatki. Lista zawiera także początek tekstu hasła, z zachowaniem pogrubień i kursywy, jeżeli tekst ma takie formatowanie. Siatka prezentuje zwarte karty z nazwą, tomem, stroną, typem i linkiem do skanu. Nawigacja znajduje się nad i pod listą, z możliwością przejścia na jej początek lub koniec.
Podhasła są oznaczone jako elementy haseł zbiorczych. Numer tomu i strony dla pod-haseł pochodzi z hasła zbiorczego. Dwie części tomu uzupełniającego są prezentowane jako "15 cz. 1" i "15 cz. 2".
Treść hasła i skany
Kliknięcie nazwy otwiera okno z pełnym tekstem, metadanymi i odsyłaczem do skanu strony na serwerze ICM Uniwersytetu Warszawskiego. Skany pozwalają porównać automatycznie przetworzoną treść z wydaniem drukowanym.
Metadane obejmują m.in. typ, warianty nazwy, informacje administracyjne i lokalizacyjne, parafie, opisane obiekty i instytucje oraz — jeżeli zostały wydobyte — liczbę mieszkańców, liczbę domów i strukturę wyznaniową. Prezentowane są dostępne pola, więc zakres informacji może być różny dla poszczególnych haseł. Dane odnoszą się do okresu opisywanego przez autorów słownika.
Technologia i ograniczenia
Aplikacja została napisana w języku Python z wykorzystaniem frameworka Flask. Wyszukiwanie tekstowe i wektorowe obsługuje silnik Meilisearch. Reprezentacje wektorowe tekstu powstają z użyciem modelu jina-embeddings-v3. Odpowiedzi i interpretację pytań obsługuje model Qwen 3.8, a dodatkową ocenę trafności — odrębny model decyzyjny jev (choć aktualnie testujemy też polski model basal-1.5).
- Tekst OCR, podział haseł i automatycznie wydobyte metadane mogą zawierać błędy.
- Wyszukiwanie semantyczne i odpowiedzi w zakładce Konwersacja mogą być niekompletne. Rozmowa nie jest narzędziem do sporządzania wyczerpujących zestawień wszystkich miejscowości.
- Przy niedostępności usług lokalnych aplikacja może korzystać z usług zewnętrznych. Aplikacja oznacza odpowiedź przygotowaną w ten sposób.
- Dodatkowa weryfikacja i pogłębiona analiza wydłużają czas przetwarzania. Serwer może przerwać obsługę zapytania trwającą dłużej niż 5 minut (300 sekund). Wówczas warto ponowić pytanie lub zawęzić jego zakres.
Kod źródłowy: aplikacja SGKP-Search oraz skrypty ekstrakcji informacji.