SGKP-Search

Wyszukiwanie, konwersacja i przeglądanie haseł Słownika Geograficznego

Aplikacja w wersji beta. Zawiera automatycznie przetworzony tekst SGKP. Treść haseł i metadane mogą zawierać literówki i błędy, które są aktualnie weryfikowane i poprawiane. Odpowiedzi generowane przez modele językowe należy sprawdzać w przywołanych hasłach i skanach stron.

SGKP-Search udostępnia tekst Słownika geograficznego Królestwa Polskiego i innych krajów słowiańskich, wraz z tomem uzupełniającym, oraz informacje wydobyte z haseł w postaci metadanych. Umożliwia odnajdywanie nazw i tematów, zadawanie pytań o treść słownika oraz przeglądanie i filtrowanie haseł.

Aplikacja powstała w Pracowni Historii Cyfrowej Instytutu Historii Polskiej Akademii Nauk w ramach projektu Geografia kulturowo-intelektualna dawnych ziem polskich pod zaborami 1865–1918 – cyfrowe vademecum.

Otwórz aplikację SGKP-Search.

Trzy sposoby korzystania ze słownika

  • Wyszukiwanie — odnajdywanie haseł według nazw, słów lub tematyki.
  • Konwersacja — pytania w języku naturalnym i odpowiedzi opracowywane na podstawie fragmentów słownika, z odsyłaczami do źródeł.
  • Przeglądanie — uporządkowana lista haseł, którą można zawężać filtrami.

Interfejs jest dostępny po polsku i angielsku. Przełączniki w nagłówku pozwalają zmienić język oraz wybrać jasny lub ciemny motyw. Okno "Pomoc" zawiera podstawowe wskazówki użytkowania.

Wyszukiwanie

Wyszukiwanie

Wpisz nazwę, wyrażenie lub pojęcie, a następnie wybierz jeden z trzech trybów:

  • Pełnotekstowe — wyszukuje słowa w treści haseł. Jest przydatne przy szukaniu nazw miejscowości, osób i konkretnych terminów i pojęć. Wyszukiwanie dopuszcza pewną tolerancję dopasowania wyrazów, co pozwala odszukać warianty nazwy czy też nazwy z literówkami np. w wyniku OCR.
  • Hybrydowe — łączy wyszukiwanie słów z podobieństwem znaczeniowym. Suwak "Udział semantyki" określa proporcję obu metod.
  • Semantyczne — odnajduje fragmenty zbliżone znaczeniowo do zapytania. Warto wpisywać określenia tematyki, np. "wydobywanie surowców" lub "mielenie ziarna". Wyniki mogą dotyczyć szukanego tematu, mimo że nie zawierają dokładnie użytych słów.

W trybie semantycznym można włączyć "Dodatkową weryfikację wyników". Model decyzyjny porównuje wówczas zapytanie ze znalezionym fragmentem hasła i odrzuca wyniki ocenione jako niezwiązane z tematem. Trzeba pamiętać, że taka weryfikacja wydłuża wyszukiwanie i również może popełniać błędy.

Wyniki są prezentowane według trafności, zwykle po 20 na stronie. Każda karta zawiera nazwę, podstawowe informacje o haśle, fragment tekstu oraz odsyłacz do skanu. Wyszukiwanie semantyczne wskazuje podobieństwo tematyczne; nie gwarantuje pełnego zestawienia wszystkich haseł dotyczących danego zagadnienia.

Filtry i metadane

W każdej zakładce po lewej stronie dostępny jest zwijany panel filtrów. Można wybrać tom, powiat i zakres haseł: wszystkie hasła, tylko miejscowości albo tylko hasła niebędące miejscowościami.

  • Dla miejscowości dostępne są: przynależność do Królestwa Polskiego, typ punktu osadniczego, gubernia, gmina i parafia katolicka. Gminę i parafię wybiera się z listy po wpisaniu fragmentu nazwy.
  • Dla innych haseł można wybrać typ, np. rzekę, jezioro lub górę. Lista typów powstaje na podstawie metadanych źródłowych.
  • Filtry w sekcji "Informacje w haśle" wymagają obecności adnotacji w wybranych kategoriach. Zaznaczenie kilku kategorii oznacza, że hasło musi zawierać informacje o każdej z nich.

Obecnie dostępnych jest 28 kategorii informacji, zebranych w sześć zwijanych grup:

  • Obiekty i dziedzictwo: obiekty sakralne, dwory i pałace, zabytki, znaleziska archeologiczne, ogrody i architektura krajobrazu, nekropolie.
  • Gospodarka: zakłady przemysłowe, młyny, rzemiosło, handel, hodowla.
  • Transport i łączność: poczta i telegraf, stacje kolejowe, urzędy i obiekty celne, żegluga i przeprawy.
  • Urzędy, sądy i wojsko: urzędy, sądy, wojsko.
  • Edukacja, zdrowie i dobroczynność: szkoły, opieka zdrowotna, uzdrowiska, dobroczynność, bursy.
  • Kultura i książka: biblioteki, kolekcjonerstwo, drukarnie, muzealnictwo, księgarnie.

Brak adnotacji nie oznacza braku obiektu. Filtry korzystają z wydobytych automatycznie metadanych, a nie ze wszystkich wzmianek w treści. Niekompletne lub błędne metadane mogą więc wpływać na wynik.

Konwersacja

Konwersacja

W tej zakładce można zadawać pytania o informacje zawarte w słowniku. Aplikacja interpretuje pytanie, wyszukuje fragmenty i przygotowuje odpowiedź z numerowanymi odsyłaczami do wykorzystanych haseł. Kolejne pytanie może nawiązywać do wcześniejszej odpowiedzi. Filtry pozwalają ograniczyć zakres źródeł.

Na ekranie znajduje się dziesięć przykładowych pytań. Link "Więcej przykładów" otwiera pełną listę z podziałem tematycznym i filtrowaniem tekstowym. Wybranie pytania z tego okna wpisuje je do pola Konwersacji, gdzie można je zmienić i ustawić filtry przed wysłaniem.

Przykłady pytań:

  • "Co wiadomo o miejscowości Barcząca?"
  • "W których miejscowościach znajdowały się huty szkła?"
  • "Jakie znaleziska archeologiczne znajdowały się w miejscowościach powiatu warszawskiego?"
  • "Ilu robotników pracowało w zakładach Żyrardowa i jakie wyroby tam wytwarzano?"
  • "W ilu hasłach pojawiają się informacje o bibliotekach?"

Lista przykładowych pytań

Dwie opcje pozwalają zmienić sposób przygotowania odpowiedzi:

  • Dodatkowa weryfikacja wyników — model decyzyjny sprawdza związek wyszukanych fragmentów z pytaniem przed przekazaniem ich do modelu przygotowującego odpowiedź.
  • Pogłębiona analiza — włącza tryb rozumowania modelu podczas przygotowywania końcowej odpowiedzi. Może znacznie wydłużyć oczekiwanie; nie oznacza automatycznie większej liczby źródeł ani pełniejszej odpowiedzi.

Przy pytaniach o liczbę haseł zawierających informacje z obsługiwanej kategorii aplikacja może zliczyć adnotowane hasła z uwzględnieniem filtrów. Taki wynik oznacza liczbę haseł z metadanymi, a nie liczbę obiektów, np. bibliotek lub urzędów, ani wszystkich wzmianek o nich w słowniku.

W angielskiej wersji językowej aplikacji można zadawać pytania w języku angielskim, pytanie jest automatycznie tłumaczone na polski na potrzeby wyszukiwania w polskim tekście SGKP, a odpowiedź jest przygotowywana po angielsku. Przetwarzanie jest sygnalizowane komunikatami o kolejnych etapach; przy odpowiedzi wyświetlany jest czas jej przygotowania.

"Pobierz PDF" zapisuje rozmowę wraz ze źródłami. "Wyczyść rozmowę" usuwa bieżącą konwersację z karty przeglądarki.

Przykład konwersacji

Przeglądanie

Zakładka pokazuje hasła i pod-hasła, po 50 na stronie. Domyślnie wyświetlany jest tom 1. Można wybrać inny tom lub wszystkie tomy, zawęzić listę nazwą albo fragmentem nazwy oraz korzystać z pozostałych filtrów. Lista odświeża się po każdej zmianie filtrów.

Dostępne są widoki listy i siatki. Lista zawiera także początek tekstu hasła, z zachowaniem pogrubień i kursywy, jeżeli tekst ma takie formatowanie. Siatka prezentuje zwarte karty z nazwą, tomem, stroną, typem i linkiem do skanu. Nawigacja znajduje się nad i pod listą, z możliwością przejścia na jej początek lub koniec.

Podhasła są oznaczone jako elementy haseł zbiorczych. Numer tomu i strony dla pod-haseł pochodzi z hasła zbiorczego. Dwie części tomu uzupełniającego są prezentowane jako "15 cz. 1" i "15 cz. 2".

Treść hasła i skany

Kliknięcie nazwy otwiera okno z pełnym tekstem, metadanymi i odsyłaczem do skanu strony na serwerze ICM Uniwersytetu Warszawskiego. Skany pozwalają porównać automatycznie przetworzoną treść z wydaniem drukowanym.

Metadane obejmują m.in. typ, warianty nazwy, informacje administracyjne i lokalizacyjne, parafie, opisane obiekty i instytucje oraz — jeżeli zostały wydobyte — liczbę mieszkańców, liczbę domów i strukturę wyznaniową. Prezentowane są dostępne pola, więc zakres informacji może być różny dla poszczególnych haseł. Dane odnoszą się do okresu opisywanego przez autorów słownika.

Technologia i ograniczenia

Aplikacja została napisana w języku Python z wykorzystaniem frameworka Flask. Wyszukiwanie tekstowe i wektorowe obsługuje silnik Meilisearch. Reprezentacje wektorowe tekstu powstają z użyciem modelu jina-embeddings-v3. Odpowiedzi i interpretację pytań obsługuje model Qwen 3.8, a dodatkową ocenę trafności — odrębny model decyzyjny jev (choć aktualnie testujemy też polski model basal-1.5).

  • Tekst OCR, podział haseł i automatycznie wydobyte metadane mogą zawierać błędy.
  • Wyszukiwanie semantyczne i odpowiedzi w zakładce Konwersacja mogą być niekompletne. Rozmowa nie jest narzędziem do sporządzania wyczerpujących zestawień wszystkich miejscowości.
  • Przy niedostępności usług lokalnych aplikacja może korzystać z usług zewnętrznych. Aplikacja oznacza odpowiedź przygotowaną w ten sposób.
  • Dodatkowa weryfikacja i pogłębiona analiza wydłużają czas przetwarzania. Serwer może przerwać obsługę zapytania trwającą dłużej niż 5 minut (300 sekund). Wówczas warto ponowić pytanie lub zawęzić jego zakres.

Kod źródłowy: aplikacja SGKP-Search oraz skrypty ekstrakcji informacji.