Dane firmowe a AI. Ponad 300 ZB danych w 2028 roku

Firmy wytwarzają coraz więcej danych, ale ich rosnący wolumen nie oznacza automatycznie większej wartości biznesowej. Problem określany jako cyfrowe chomikowanie (digital hoarding) dotyczy nie tylko kosztów przechowywania danych. Nadmiarowe, nieaktualne lub powielone informacje zwiększają ryzyko naruszeń bezpieczeństwa i przepisów, a także utrudniają zarządzanie zasobami IT.

Na problem ten zwraca uwagę Tomasz Krajewski, dyrektor techniczny sprzedaży na Europę Wschodnią w firmie Veeam. Według danych IDC ilość informacji generowanych przez przedsiębiorstwa wzrośnie z 84,9 ZB w 2023 r. do 317,1 ZB w 2028 r. Oznacza to średni roczny wzrost o 30,2 proc. Jednocześnie część tych zasobów szybko się dezaktualizuje i pozostaje w firmowych systemach mimo utraty znaczenia dla działalności.

Dane rosną szybciej niż możliwości ich przechowywania

IDC prognozuje, że w latach 2023–2028 ilość wytwarzanych danych będzie rosła średnio o 25,1 proc. rocznie, podczas gdy ilość danych przechowywanych zwiększy się o 16,6 proc. Oznacza to, że firmy już dokonują selekcji informacji, jednak w ich środowiskach IT nadal pozostają ogromne ilości danych, które nie mają istotnego zastosowania biznesowego.

Szczególnym wyzwaniem są tzw. ROT data – informacje redundantne, przestarzałe lub pozbawione istotnej wartości. Mogą to być stare wersje dokumentów, kopie plików, nieaktualne bazy danych czy materiały związane z zakończonymi projektami. Pojedynczy plik nie stanowi problemu, ale miliony takich informacji rozproszonych pomiędzy lokalnymi systemami, chmurą i innymi środowiskami przez lata tworzą realne ryzyko dla organizacji.

Problem jest szczególnie istotny w przypadku danych nieustrukturyzowanych. W 2023 r. stanowiły one około 93 proc. wszystkich danych tworzonych na świecie, a w 2028 r. nadal mają odpowiadać za ponad 82 proc. Są to m.in. dokumenty, wiadomości, zdjęcia, nagrania i inne pliki, których zawartość trudniej automatycznie analizować i klasyfikować.

Jakość danych ma znaczenie

Rosnąca popularność generatywnej AI sprawia, że problem jakości danych nabiera dodatkowego znaczenia. Systemy sztucznej inteligencji mogą analizować ogromne zbiory informacji, ale same nie są w stanie zagwarantować, że wszystkie wykorzystane dane są aktualne, prawidłowe i odpowiednio sklasyfikowane.

Jeżeli do analizy trafią informacje nieaktualne lub pozbawione znaczenia biznesowego, AI może na ich podstawie przygotować błędne wnioski i rekomendacje. W efekcie organizacja może dysponować odpowiednią infrastrukturą do wykorzystania AI, ale jednocześnie nie mieć wystarczającej kontroli nad danymi, na których systemy te pracują.

Ryzyko rośnie również wtedy, gdy przedsiębiorstwo nie ma pełnej wiedzy o tym, jakie dane posiada, gdzie są one przechowywane i kto może z nich korzystać. Rozproszenie informacji, zbyt szerokie uprawnienia czy niewłaściwie sformułowane polecenia dla systemów AI mogą prowadzić do wykorzystania danych, które nie powinny być podstawą analizy. Konsekwencją mogą być błędne decyzje, naruszenie poufności, problemy regulacyjne lub szkody wizerunkowe.

Najpierw trzeba wiedzieć, jakie dane ma firma

Punktem wyjścia do bezpiecznego wykorzystania AI powinno być uporządkowanie firmowych zasobów informacyjnych, podkreśla Tomasz Krajewski. Oznacza to przede wszystkim określenie, gdzie dane są przechowywane, jak długo powinny być zachowane, kto ma do nich dostęp oraz które informacje są nadal wykorzystywane w działalności.

Pomocne są w tym klasyfikacja danych i metadane opisujące ich pochodzenie, charakter oraz znaczenie. Automatyczne porządkowanie, oznaczanie i analiza zasobów mogą ułatwić zarządzanie zarówno danymi ustrukturyzowanymi, jak i nieustrukturyzowanymi.

Nie chodzi przy tym o mechaniczne usunięcie jak największej liczby informacji. Część danych musi być przechowywana ze względów biznesowych, prawnych lub regulacyjnych, a niektóre mogą okazać się potrzebne w przyszłości. Kluczowe jest więc świadome podejmowanie decyzji dotyczących ich przechowywania, zamiast pozostawiania ich w systemach tylko dlatego, że dotychczas nikt nie zdecydował o ich usunięciu.

AI potrzebuje uporządkowanych danych

Porządkowanie danych nie może być jednorazowym projektem. Ich ilość nadal będzie szybko rosła, a informacje będą powstawać w coraz większej liczbie miejsc – od firmowych centrów danych, przez chmurę, po urządzenia brzegowe i rozwiązania IoT.

IDC prognozuje, że ilość danych ustrukturyzowanych w firmach wzrośnie z 9,4 ZB w 2023 r. do 69,7 ZB w 2028 r. Jednocześnie przedsiębiorstwa będą musiały zarządzać coraz większymi zasobami danych powstających w różnych środowiskach IT.

Dla organizacji oznacza to potrzebę stałego monitorowania tego, jakie dane posiadają i w jaki sposób są one wykorzystywane. AI może zwiększyć wartość biznesową informacji, ale jej skuteczność zależy również od jakości danych, które otrzymuje.

Dlatego uporządkowanie danych nie powinno być traktowane jako etap poprzedzający wdrożenie sztucznej inteligencji. To raczej jeden z fundamentów świadomego i bezpiecznego wykorzystania AI w przedsiębiorstwie.

(grafika tytułowa – źr. materiały prasowe, Veeam)

Zostaw komentarz

Twój adres e-mail nie zostanie opublikowany. Wymagane pola są oznaczone *

Przewijanie do góry