LangDex

Education & Academia

Language departments need vocabulary lists graded by JLPT/HSK/CEFR, frequency data for curriculum design, and structured data for assessment generation. Building this from scratch for each language is redundant. LangDex provides proficiency-tagged, frequency-ranked lexicons ready for curriculum integration.

The Challenge

The Curriculum Data Problem

  • 1JLPT N5 vocabulary lists are curated manually—no authoritative source provides proficiency-tagged lexicons programmatically
  • 2Frequency data (Leipzig, OpenSubtitles) requires separate ingestion and normalization per language
  • 3Assessment item generation (MCQ distractors, cloze deletions) requires semantic relationships not present in flat word lists
  • 4LMS integration (Canvas, Moodle) requires reformatting vocabulary data per platform's import schema
  • 5Linguistics courses use static example sets; students can't query live data for hands-on computational exercises
The Solution

Curriculum-Aligned Data Layer

LangDex provides pre-structured vocabulary data for educational use. Japanese lexemes tagged with JLPT levels (N5-N1), Chinese with HSK (1-6), European languages mappable to CEFR (A1-C2). Frequency rankings from OpenSubtitles (190 languages) and Leipzig corpora. Graph structure enables distractor generation for assessments. API designed for LMS integration latency requirements.

Features

Key Capabilities

Proficiency Tags

JLPT N5-N1 on Japanese lexemes, HSK 1-6 on Chinese. Query 'all N3 vocabulary' or 'HSK 4 verbs' directly.

Frequency Rankings

OpenSubtitles frequency for 190 languages, Leipzig corpus rankings. Prioritize high-yield vocabulary in curriculum.

Assessment Generation

Graph-based distractor selection: phonetically similar, same radical, semantic neighbors. Auto-generate MCQs, cloze, matching.

LMS Integration

REST API with response shapes optimized for Canvas, Moodle, Blackboard import. Sub-100ms vocabulary lookups.

Multi-Language Parity

Same API for Japanese, Spanish, Arabic, Swahili. No per-language integration work—universal schema.

Live Research Queries

Linguistics students query production data: phoneme inventories, morphological paradigms, etymology chains. Real computational linguistics.

Who Is This For

Perfect For

University language departmentsK-12 language programs (immersion, FLES)EdTech platforms (Duolingo-style apps)Textbook publishers (curriculum supplements)Assessment companies (ACTFL, JLPT prep)Online course creators (Udemy, Coursera instructors)Linguistics programs (computational courses)Language certification bodies

Ready to Get Started?

Join our waitlist to get early access to LangDex's API and start building.