Experimental
PAUL Open is an open research project fine-tuning Gemma 4 for multilingual Indian-language STEM education and life-sciences reasoning.
5 Model Tiers
10 Languages
245 Curated Training Examples
Research Thesis
Large language models perform unevenly across Indian languages and STEM domains. Existing open models default to English-centric reasoning. PAUL Open investigates whether targeted behavioral fine-tuning on a small, carefully curated corpus can reliably specialize Gemma 4 for Socratic tutoring, scientific translation, and pedagogical interaction in 10 Indian languages—reproducibly, on consumer hardware.
What has been built
Honest status of engineering and research artifacts.
Model registry (5 tiers)Built
Training pipeline (SFT + DPO)Built
Training data (180 SFT + 65 DPO)Curated
Baseline evaluation (50 cases)Built
Preservation suite (30 cases)Frozen
Behavioral suite (30 cases)Frozen
Contamination preventionBuilt
E4B training runExecuted
Published benchmark resultsPending
Human evaluationPlanned
Capability Domains
PendingTargeted Behaviors (DPO)
- Guided Socratic Tutoring: Probing intuition without premature answers.
- Concise STEM Calculation: Structured formulation with minimal preamble.
- Clean Direct Translation: Accurate scientific terminology without meta-talk.
- Natural Indic Pedagogical Tone: Engaging classroom register without hyper-Sanskritization.
Preserved Capabilities (SFT)
- Teacher Assistance: Formative assessment and lesson planning.
- Scientific Explanation: Accessible breakdown of complex physical phenomena.
- Life Sciences: Detailed reasoning in biology and medical sciences.
- Safety & Boundaries: Ethical constraints and anti-anthropomorphism.
Model Tiers
paul-open-e4b-it
BuiltPrimary experimental pilot. Fits easily on a single T4 or RTX 3060.
Parameters
4.5B
VRAM (4-bit)
~6GB
Context
8K
Architecture
Gemma 4
paul-open-12b-it
PlannedIntermediate target. Requires an RTX 3090/4090 for 4-bit inference.
Parameters
12B
VRAM (4-bit)
~12GB
Context
8K
Architecture
Gemma 4
paul-open-26b-it
PlannedFull capability target. Requires 24GB VRAM for 4-bit, or dual cards for unquantized inference.
Parameters
26B
VRAM (4-bit)
~24GB
Context
8K
Architecture
Gemma 4
Quick Start
Reproduce the research environment locally using uv.
Quick Start — Local Development
$ git clone https://github.com/foundrypaul-cloud/paul-open.git$ cd paul-open$ uv sync --extra all$ uv run pytest