Při lokálním testu mi přijde, že složky jobs (vstupní data uploadovaná pro zpracování) a results (výsledné zipy) jsou v podstatě trvalé - nenašel jsem možnost nastavit aplikaci, aby je mazala.
Vstupy by se přitom v produkci potom daly mazat prakticky okamžitě po přechodu jobu do stavu done.
Výsledky by se v produkci také nemusely držet donekonečna, ale třeba v řádu dní/týdnů, podle toho, jak dlouho reálně trvá, než se dostanou do digitální knihovny.
Pokud nyní žádný mechanismus pro mazání neexistuje, navrhoval bych zavést samostatný jednoduchý cron/scheduled proces, který:
- najde joby starší než nastavený limit,
- smaže jejich soubory (jobs/, results/),
- a zároveň job v DB označí (nový stav EXPIRED, a/nebo timestamp result_deleted_at) - v současnosti totiž můžu (jestli to chápu správně) sice data z disku smazat, ale zůstanou mi záznamy v databázi, pokud je nesmažu ručně.
Při lokálním testu mi přijde, že složky
jobs(vstupní data uploadovaná pro zpracování) aresults(výsledné zipy) jsou v podstatě trvalé - nenašel jsem možnost nastavit aplikaci, aby je mazala.Vstupy by se přitom v produkci potom daly mazat prakticky okamžitě po přechodu jobu do stavu done.
Výsledky by se v produkci také nemusely držet donekonečna, ale třeba v řádu dní/týdnů, podle toho, jak dlouho reálně trvá, než se dostanou do digitální knihovny.
Pokud nyní žádný mechanismus pro mazání neexistuje, navrhoval bych zavést samostatný jednoduchý cron/scheduled proces, který: