Observación: Antes de usar TextSTAT lee las observaciones a tener en cuenta al respecto del uso de dicho programa en http://webs.uvigo.es/jmv/docs/practicas/practica1/observaciones-textstat.pdf. Así, por ejemplo, es muy importante que [sic] “Antes de añadir documentos al corpus hay que seleccionar la codificación ISO-8859-1 (Latin-1) o bien ISO-8859- 2 (Latin-2) para que reconozca correctamente los caracteres con tilde [p. 2]”. Si con esta codificación te siguen saliendo “símbolos raros” en la acentuación puedes probar con el formato de codificación “UTF-8 (Unicode)”.
*** ESTO NO LO HICIMOS EN ESTA SEGUNDA CLASE DE LA SEMANA 5 O S-5. DEBÉIS TENER MUY EN CUENTA QUE EN LA GRABACIÓN NO SE LIMPIÓ LA OBRA EN FORMATO HTML NI SE USÓ COMO PARABRA A USAR EN LA CONCORDANCIA LA PALABRA "hombre". ES POR ELLO QUE, SI QUERÉIS CONSULTAR LA "GRABACIÓN CORRECTA DEBÉIS CONSULTAR LA GRABACIÓN DE LA PRIMERA CLASE DE LA SIGUIENTES SEMANA (SEMANA 6 O S-6) ***
*
*
v
Antes de poder analizar con el programa lexicográfico TextSTAT las obras descargadas en formato HTM es necesario eliminar de las mismas los comentarios que los promotores del "Proyecto Gutenberg" han insertado al principio y al final de los documentos. Dichos comentarios se distinguen fácilmente porque están en un tipo de letra muy diferente ("Courier") al texto de las obras. Para eliminar dichos comentarios usaremos el programa Kompozer que usamos para la creación de las páginas webs en el encargo-2 anterior.
Una vez abierta las obras literarias en KompoZer procedemos a seleccionar y borrar las anotaciones iniciales y finales de dicha obras. Salimos y guardamos los cambios. Por último, comprobamos abriendo el archivo guardado con un navegador que los comentarios han sido efectivamente borrados.
^
*
*
*** ESTO NO LO HICIMOS EN ESTA SEGUNDA CLASE DE LA SEMANA 5 O S-5. TAMPOCO EL USAR LA PALABRA "hombre" PARA LA CONCORDANCIA. APARECERÁ GRABADO AL INICIO DE LA CLASE DE LA SIGUIENTE SEMANA (SEMANA 6 O S-6) DONDE VOLVEREMOS A REPETIR TODO EL PROCESO, PERO YA DE MANERA CORRECTA ***
El siguiente paso a realizar es descargar de la página web de la materia el programa lexicográfico TextSTAT. Para ello lo descargamos del enlace correspondiente (http://jmv.webs.uvigo.es/docs/practicas/practica1/textSTAT-2.9.zip) en nuestra carpeta de trabajo, lo descomprimimos (con 7-zip con la opción "extraer aquí") y verificamos que en la carpeta resultante "TextSTAT" está ele ejecutable del programa "TextSTAT.exe" (con un icono amarillo muy característico y las letras "TS")
Activamos el programa "TextSTAT" haciendo "doble clic" con el botón izquierdo del ratón encima del archivo "TextSTAT.exe". Se abrirá el programa lexicográfico. Es de suponer que se abra la versión en español del mismo. Dicha interfaz está "muy mal traducida/localizada" (lo cual nos servirá de ejemplo y acicate en la segunda parte de este encargo para "animarnos" a traducir/localizar correctamente la interfaz original de este programa, que está en inglés, al español).
Para darnos cuenta de ello abriremos nuevamente el programa pero con su interfaz (original) en inglés. Para ello seleccionaremos la opción "Lenguaje > English" del menú del programa, aceptaremos el cambio, saldremos del programa, y volveremos a entrar. Nos aparecerá ahora la interfaz en inglés del programa. Nos fijamos especialmente en las diferentes opciones del menú "corpus" en inglés.
Volvemos a cambiar a la interfaz en español. El siguiente paso a llevar a cabo es, según consta en el enunciado del encargo-3, "elaborar un listado de las palabras o formas (con sus correspondientes frecuencias) que aparecen en las obras literarias en cuestión (ordenado alfabéticamente y sin distinción de mayúsculas o minúsculas)."
Para ello, los pasos a seguir son los siguientes:
1) En primer lugar, crear un "nuevo corpus" con la opción "Corpus > Nuevo corpus ("Nueva unidad de análisis")", con el nombre de "corpus1.crp" para la "obra1.htm" y "corpus2.crp" para la "obra2.htm" (aquí sólo mostraremos los pasos para la "obra1.htm"). Estos archivos creados son simples receptáculos para la información que crearemos después; por ello, de hecho, no están asociados a ningún programa en concreto.




2) A continuación cargar el "archivo guardado en el ordenador a analizar" ("obra1.htm" u "obra2.htm", según corresponda) a través de la opción "Corpus ("Unidad de análisis") > Añadir archivo local ("Adicionar archivo local")". Notad al respecto que la opción "Añadir archivo local ("Adicionar archivo local")" del menú "corpus ("Unidad de análisis")" permite analizar archivos o páginas web en línea, sin necesidad de descargarlos previamente. Y, la ventana final resultante después de cargar el archivo en cuestión, nos da idea de que el programa permite cargar otros nuevos archivos (por ejemplo, todas las obras de un mismo autor) y analizar todos ellos, al unísono. Por cierto, si observáis que el tamaño de la obra es de 1 Kb (en este caso o siempre que descarguéis algún archivo de Internet) ello indica normalmente que el archivo en cuestión se ha descargado mal. Debéis borrarlo y volverlo a descargar.



¡OJO, si en vez de una sucesión de carpetas acabadas en el archivo "obra1.html" u "obra2.html", el programa muestra una "p inversa o q" o da un mensaje de error; ello indica que en algunas de las subcarpetas tiene un espacio, un acento, una "ñ", etc. (algún carácter "no inglés", vaya), o que la obra en cuestión se ha descargado mal (como comentamos antes, igual tiene un tamaña de 1 Kb). Debes cambiar el nombre a dichas carpetas para que la obra literaria se cargue y/o volver a descargar la obra!
Para proceder al listado de las palabras por frecuencias, listadas alfabéticamente y sin distinción de mayúsculas y minúsculas, procedemos a seleccionar la pestaña "Formas" y las opciones "ordenar alfabéticamente" y "ordenar sin distinción de tipo (letras mayúsculas o minúsculas)". Por último pulsamos el botón "lista de frecuencia(s)". En cuestión de segundos obtenemos el listado solicitado. Tened en cuenta que, con anterioridad a la existencia de los programas lexicográficos, este proceso, con la obra "El Quijote", por ejemplo, requería de 6 meses de trabajo por parte de 3 personas; ya que requería la elaboración de 22.942 fichas de trabajo (que es el número de palabras diferentes de la obra), previo análisis de 383.552 palabras, y la anotación en las mismas de los contextos en las cuales aparecían. Ahora, con el programa lexicográfico, este proceso tarda ¡2 segundos!

En el supuesto caso de que no aparezcan o aparezcan mal los acentos de las palabras, ello se debe a la diferente codificación entre el texto analizado y la configuración del programa TextSTAT. Debemos asegurarnos que la codificación que aparece en la obra a analizar (que aparece en la obra en el comentario superior del "Proyecto Gutenberg", antes de limpiar dichos comentarios) coincide con la opción seleccionada a través de "Codificación". ¡Ojo; la codificación del programa TextSTAT, por defecto, está en consonancia con la lengua de la propia interfaz del programa! Si usáis la interfaz en español la codificación será "ISO-8859-1", y si esta codificación coincide con la codificación de las obras a analizar, se verán los acentos. Por contra, si usáis la interfaz del programa en inglés, la codificación del programa será "UTF-8 (Unicode)" y probablemente no se verán los acentos de las obras literarias si están en la codificación "ISO-8859-1".


Observación: uso del programa lexicográfico TextSTAT para la localización de "candidatos a términos" en un texto especializado. Aunque aquí no vamos a hacerlo por tratarse de un texto literario, TextSTAT también puede usarse para la "localización de candidatos a términos" en textos especializados (por ejemplo, para la realización del trabajo de terminología de la materia del mismo nombre del grado, si es el caso). Para ello basta con usar las opciones "ordenar por frecuencia", "frecuencia mínima" y "frecuencia máxima". La idea básica es que, en un texto especializado, de un determinado ámbito X, una palabra candidata a ser un buen término de dicho ámbito X sería, por ejemplo, una palabra que aparezca un mínimo de ¿10 veces en el texto y un máximo de 15 veces en el texto? (los parámetros me los he inventado yo; vosotros/as podríais usar los parámetros que creyeseis más ajustados). Por debajo del umbral de 10 veces es de suponer que dicha palabra no sería del ámbito X; y, por encima del umbral de 15 veces, es de suponer que la palabra sería ya demasiado genérica para ser un término especializado y formaría parte ya del lenguaje general. Hemos hecho la prueba con nuestra obra1 (aunque, repito, es un texto literario y no un texto especializado) y el resultado ha sido el que aparece a continuación. Serían 982 palabras "candidatas a términos"; todavía demasiadas (es "normal" que esto suceda en un texto de tipo literario, ya que en dicho texto no hay términos por no tratarse de un texto especializado; en un texto especializado el número de palabras obtenidas a buen seguro sería muchísimo menor), por lo que (de tratarse de un texto especializado; cosa que repito no ocurre en este caso) deberíamos seguir especulando con los intervalos mínimo y máximo de las palabras en función del número de candidatos que quisiéramos obtener.

Por último, solo nos falta guarda (exporta) el listado (de frecuencias) en el formato abierto CSV (comma-separated values o “valores separados por comas”) con el nombre de “listado1.csv” y “listado2.csv”, respectivamente.
El programa TextSTAT permite exportar las "listas de frecuencias" en formato CSV (formato abierto) o bien en formato XLS o XSLX (formato cerrado, propietario, de Microsoft Excel).
El formato CSV, del inglés "Comma Separated Values" o "valores separados por comas" (https://es.wikipedia.org/wiki/Valores_separados_por_comas), es un formato de archivo, de formato abierto, muy sencillo, para representar datos en forma de tabla, en las que las columnas se separan por comas y las filas por saltos de línea (o <Enters>). Como sea que las comas pueden forman parte del texto de los datos, los datos se incluyen entre comillas ("") o bien se usan otros delimitadores para separar las columnas (como puedan ser, por ejemplo, los tabuladores); manteniéndose para estos casos el nombre de "formato CSV", aun no siendo las comas los delimitadores de dichos archivos.
Exportar el listado de frecuencias a formato CSV mediante la opción "Exportar > Lista de frecuencias: Archivo CSV". Guardamos el archivo generado con el nombre de "listado1.csv" (en el caso de la "obra1.htm") o de "listado2.csv" (en el caso de la "obra2.htm"). Para abrir el archivo ".csv" basta saber que dicho formato es un formato de "solo texto" y, por tanto, basta seleccionarlo con el botón izquierdo del ratón, pulsar el botón derecho del ratón, seleccionar la opción "Abrir con", y elegir el programa "bloc de notas " (o cualquier otro editor de textos). Con ello podemos dar por rematado la totalidad del apartado "1.3)" del encargo-3.