Korpuso

Reviziita versio de ĉi tiu paĝo, aprobita je 15 feb. 2015, estis bazita sur ĉi tiu versio.

Ĉi tiu artikolo temas pri Korpuso (tekstaro). Por informoj pri divido de armeo, vidu la artikolon Korpuso (armeo).

Korpuso (aŭ tekstaro) estas aro da tekstoj aŭ transskribitaj konversacioj/paroloj, kiun oni uzas kiel tuton por studo. Komputado ne necesas, sed tre faciligas la pretigon kaj uzon de tekstaroj. Ankaŭ aro da parolregistraĵoj estas korpuso.

Multaj lingvistoj insistas, ke tekstaro devas esti morfologie markita por ebligi serĉon de gramatikaj formoj en kuntekstoj.

Celoj

Sama tekstaro povas taŭgi por pluraj celoj. En la tekstoj oni eble serĉos ekzemplojn de vortuzo por vortarfarado por stilesploro, oni eble atentos oftecon de esprimoj por lingvevolua, filologia enketo, aŭ el ne lingvistika vidpunkto, oni rigardos ĝin materialo por historio aŭ socioscienco.

Tipoj

En la preparo de korpuso oni laŭ la ebloj kaj celoj elektas la kvantojn kaj specojn de tekstoj. Kvantojn oni mezuras per vortnombroj. Tekstospecojn oni prefere variigas, se la tekstaro estas por ĝenerala lingvesploro: gazetaĵoj, beletraĵoj, sciencaj artikoloj, kompaniaj raportoj, leteroj... male oni striktigas la elekton se la celo specialas: leteroj kaj privataj dokumentoj se oni observas spontanean parolon, politikaj paroladoj kaj komentoj se oni havas ian sociologian celon, samspecaj tekstoj el sinsekvaj epokoj se oni esploras lingvan evoluon...

Simpla kunmeto de dokumentoj ne estas korpuso. Minimume la tesktoj ricevu unu saman komputan strukturon, iliaj lingvo, dato, aŭtoro aŭ deveno estu laŭeble klare kaj unuece indikitaj laŭ bibliografia normo, kaj bazaj esplorrimedoj estu provizitaj: nombradoj, indeksoj, serĉiloj...

Pro tio kaj ankaŭ por faciligi la komparon de rezultoj de esploroj super pluraj tekstaroj, oni provis normi la prezentojn, ordinare surbaze de sgml aŭ xml. La tekstokoda iniciato, mallonge tei, estas tia sufiĉe konata normo komencita en jaro 1988. sed ĝi ne estas la sola.

La lingvistikaj bezonoj ne limiĝas je haveblo de vortoj. ofte lingvistoj bezonas pliajn informojn pri vortklasoj, vortroloj aŭ aliaj gramatikaĵoj, kaj ankaŭ aliaj sciencistoj pli facile studas la temojn de tekstoj se antaŭanalizo estas provizita. Tial oni distingas inter senmarkaj tekstaroj el nudaj dokumentoj nur formate glatigitaj, kaj markhavaj tekstaroj en kiuj vortojn, frazojn aŭ aliajn erojn akompanas kritikaj informoj. La markojn oni ĵargone nomas etikedoj.

Problemoj

Reprezenta tekstaro ne vere ekzistas, ĉar la kvanto de diversspecaj tekstoj en la mondo ne estas superrigardebla. Tekstaro necese entenos 0, 10 aŭ 36 elcentojn da gazetaj artikoloj, sed aserti ke en iu lingvo ekzistas tia aŭ tia elcento da gazetaj tekstoj simple sensencas.

Eĉ en tre granda tekstaro, iuj lingvaj fenomenoj maloftas kaj sekve aperas nur en hazardaj kuntekstoj. La sama esploro super diversgrandaj tekstaroj ofte rezultas malsimile. La ĝusta interpreto de tekstaraj esploroj do komence facilas, sed baldaŭ necesigas almenaŭ prudenton, kaj pli bone statistikan kompetenton.

Ekzemploj

Danke al la teĥnika progreso komputaj tekstaroj aperis fine de la 1960-aj jaroj kaj iĝis vaste uzataj en la 1990-aj kun interreta aliro.

Frua epokfara ekzemplo estis la Brown-a korpuso de normala usonangla lingvo, el la fino de la 1960-aj, kiu estis la unua atingi unu milionon da vortoj. Ĝi estas markhava tekstaro kun propra sortimento de lingvosciencaj vortklasaj markoj.

Esperanto

La plej grava tekstaro de Esperanto estas la Tekstaro de Esperanto, kiu estas pure skriblingva kaj enhavas 4.266.767 da vortoj. Nuntempe ESF financas projekton por krei parollingvan korpuson (EPAK). Pli ampleksa ol la Tekstaro de Esperanto estas la Tekstaro de Eckhard Bick kun 18 milionoj da vortoj; ĝiaj tekstoj tamen estas malpli atenteme kolektitaj, kaj ĝi havas multe malpli da serĉfunkcioj ol la Tekstaro de Esperanto.

Vidu ankaŭ

Komputila lingvistiko

Eksteraj ligiloj

Serĉilo por la Tekstaro de Esperanto
Tekstaro de Eckhard Bick
Interreto uzata kiel tekstaro
korpuso de la Esperanta Vikipedio - senmarka, sed libere elŝutebla