WaveRedact
Pipeline open-source in Python per la rimozione automatica dei dati sensibili (PII) dalle tracce audio. Sfrutta modelli NER (GLiNER2) e LLM locali (llama.cpp) per analizzare il contesto e censurare le informazioni interamente offline.
Pipeline open-source in Python per la rimozione automatica dei dati sensibili (PII) dalle tracce audio. Sfrutta modelli NER (GLiNER2) e LLM locali (llama.cpp) per analizzare il contesto e censurare le informazioni interamente offline.
Modello addestrato su 1.445.302 linee di canzoni rap prese da questo dataset su kaggle. Sperimentazione con embedding e rete feed-forward per generare nuovi nomi.
Train loss: 3.1864, Val loss: 3.9321, Tempo (h): 45.44.
Modello addestrato su 1.825.433 nomi (dataset Kaggle). Sperimentazione con embedding e rete feed-forward per generare nuovi nomi. Loss media (4-gram): 2.0107.
Classificatore k-Nearest Neighbors per distinguere casi maligni da benigni. Accuracy: 96.48%, Recall: 93.49%. Notebook completo su Kaggle.