KLaSAn
Resource Units

All 68 LaSAn Units

Each unit contributes to the Language Resource Index (LRI). Mapped units show scores from baseline data; others are placeholders until data is available.

LRI (6 mapped)
75.3
Current baseline
LRI (68 total)
6.6
If unmapped = 0
RCR
9%
Units ≥ Functional
Mapped
6 / 68
From corpus data
Lexical Resources
LEX-0176
General dictionary
ceiling: 50,000 entries
LEX-0278
Bilingual dictionary
ceiling: 30,000 pairs
LEX-03
Thesaurus
ceiling: 60 domains
LEX-0459
Specialised glossaries
ceiling: 5,000 terms
LEX-05
Wordlists
ceiling: 3,000 total words
LEX-06
Etymology
ceiling: 10,000 words
LEX-07
Dialectal vocabulary
ceiling: 5,000 items
LEX-08
Neologism registry
ceiling: 2,000 terms
Grammatical Resources
GRM-01
Reference grammar
ceiling: 100%
GRM-02
Pedagogical grammar
ceiling: 100%
GRM-03
Phonology
ceiling: 100%
GRM-04
Morphology
ceiling: 100%
GRM-05
Syntax
ceiling: 100%
GRM-06
Tone / prosody
ceiling: 100%
GRM-0798
Interlinear texts
ceiling: 5,000 sentences
GRM-08
Comparative grammar
ceiling: 20 (L×D)
Text Corpora
COR-0167
General corpus
ceiling: 5,000,000 words
COR-02
Parallel corpus
ceiling: 500,000 pairs
COR-03
Annotated corpus
ceiling: 500,000 tokens
COR-04
News corpus
ceiling: 10,000 articles
COR-05
Religious corpus
ceiling: 500,000 words
COR-06
Literary corpus
ceiling: 1,000,000 words
COR-07
Synthetic corpus
ceiling: 2,000,000 sentences
COR-08
Historical corpus
ceiling: 200,000 words
Audio and Visual
AUD-0174
Elicited recordings
ceiling: 20,000 items
AUD-02
Spontaneous speech
ceiling: 200 hours
AUD-03
Oral literature
ceiling: 1,000 items
AUD-04
Transcribed audio
ceiling: 500 hours
AUD-05
Subtitled video
ceiling: 200 hours
AUD-06
Oral histories
ceiling: 500 interviews
AUD-07
Pronunciation reference
ceiling: 300 environments
AUD-08
Dialect recordings
ceiling: 2,000 (V×I)
Educational
EDU-01
Literacy primer
ceiling: 100%
EDU-02
Children's books
ceiling: 500 books
EDU-03
Textbooks
ceiling: 200 units
EDU-04
Teacher training
ceiling: 100%
EDU-05
Learning app
ceiling: 10,000 items
EDU-06
Flashcard sets
ceiling: 5,000 items
EDU-07
Audio learning
ceiling: 100 hours
EDU-08
Curriculum guide
ceiling: 100%
Digital and NLP
NLP-01
Keyboard
ceiling: 100%
NLP-02
Spell checker
ceiling:
NLP-03
Tokenizer
ceiling: 100%
NLP-04
POS tagger
ceiling: 100%
NLP-05
Morphological analyser
ceiling: 100%
NLP-06
TTS system
ceiling: MOS 5.0
NLP-07
ASR system
ceiling: WER 0%
NLP-08
Machine translation
ceiling: BLEU 40
NLP-09
Language model
ceiling: 5,000,000 tokens
NLP-10
Benchmark datasets
ceiling: 10 tasks
Standardisation
STD-01
Official orthography
ceiling: 100%
STD-02
Tone marking
ceiling: 100%
STD-03
Spelling standard
ceiling: 30,000 entries
STD-04
Style guide
ceiling: 100%
STD-05
Terminology standard
ceiling: 5,000 terms
STD-06
Font
ceiling: 100%
STD-07
Unicode encoding
ceiling: 100%
STD-08
ISO 639 code
ceiling: 4 steps
Cultural and Ethnographic
ETH-01
Proverbs
ceiling: 2,000
ETH-02
Folktales
ceiling: 500
ETH-03
Songs
ceiling: 500
ETH-04
Riddles
ceiling: 1,000
ETH-05
Kinship terminology
ceiling: 100%
ETH-06
Place names
ceiling: 3,000
ETH-07
Ethnobotany
ceiling: 2,000
ETH-08
Ritual language
ceiling: 50 contexts
ETH-09
Oral histories
ceiling: 300 accounts
ETH-10
Traditional knowledge
ceiling: 20 domains
How it works: LRI = average of all 68 unit scores (0–100). Each unit contributes 1/68 of the total. Six units are mapped from Kifuliiru corpus data (LEX-01, LEX-02, AUD-01, GRM-07, COR-01, LEX-04). The full methodology is on the Methodology page.