Tengo que limpiar algunas entradas de OCR que reconoce la escritura manuscrita como un galimatías. ¿Alguna sugerencia para una expresión regular para eliminar los caracteres aleatorios? Ejemplo:Regex para reemplazar galimatías
Federal prosecutors on Monday charged a Miami man with the largest case of credit and debit card data theft ever in the United States, accusing the one-time government informant of swiping 130 million accounts on top of 40 million he stole previously. , ':, Ie ':... 11'1 . '(.. ~!' ': f I I . " .' I ~ I' ,11 l I I I ~ \ :' ,! .~ , .. r, 1 , ~ I . I' , .' I ,. , i I ; J . I.' ,.\) .. . : I 'I', I .' ' r," Gonzalez is a former informant for the U.S. Secret Service who helped the agency hunt hackers, authorities say. The agency later found out that he had also been working with criminals and feeding them information on ongoing investigations, even warning off at least one individual, according to authorities. eh....l ~.\O ::t e;~~~ s: ~ ~. 0 qs c::; ~ g o t/J (Ii ., ::3 (1l Il:l ~ cil~ 0 2: t:lHj~(1l . ~ ~a 0~ ~ S' N ("b t/J :s Ot/JIl:l"-<:! v'g::!t:O -....c...... VI (:ll <' 0 := - ~ < (1l ::3 (1l ~ ' t/J VJ ~ Pl ..... .... (II
+1 porque es una pregunta interesante, a pesar de que sospecho no obtendrá una respuesta que funciona. –
Es una buena pregunta, y el reconocimiento de palabras/frases (o al revés) es un tema candente como parte de la IA. – Russell
Creo firmemente que un REGEX es la herramienta incorrecta para este trabajo. – Breton