Experimental

PAUL Open is an open research project fine-tuning Gemma 4 for multilingual Indian-language STEM education and life-sciences reasoning.

5 Model Tiers
10 Languages
245 Curated Training Examples

Research Thesis

Large language models perform unevenly across Indian languages and STEM domains. Existing open models default to English-centric reasoning. PAUL Open investigates whether targeted behavioral fine-tuning on a small, carefully curated corpus can reliably specialize Gemma 4 for Socratic tutoring, scientific translation, and pedagogical interaction in 10 Indian languages—reproducibly, on consumer hardware.

What has been built

Honest status of engineering and research artifacts.

Model registry (5 tiers)Built
Training pipeline (SFT + DPO)Built
Training data (180 SFT + 65 DPO)Curated
Baseline evaluation (50 cases)Built
Preservation suite (30 cases)Frozen
Behavioral suite (30 cases)Frozen
Contamination preventionBuilt
E4B training runExecuted
Published benchmark resultsPending
Human evaluationPlanned

Capability Domains

Pending

Targeted Behaviors (DPO)

  • Guided Socratic Tutoring: Probing intuition without premature answers.
  • Concise STEM Calculation: Structured formulation with minimal preamble.
  • Clean Direct Translation: Accurate scientific terminology without meta-talk.
  • Natural Indic Pedagogical Tone: Engaging classroom register without hyper-Sanskritization.

Preserved Capabilities (SFT)

  • Teacher Assistance: Formative assessment and lesson planning.
  • Scientific Explanation: Accessible breakdown of complex physical phenomena.
  • Life Sciences: Detailed reasoning in biology and medical sciences.
  • Safety & Boundaries: Ethical constraints and anti-anthropomorphism.

Model Tiers

paul-open-e4b-it

Built

Primary experimental pilot. Fits easily on a single T4 or RTX 3060.

Parameters
4.5B
VRAM (4-bit)
~6GB
Context
8K
Architecture
Gemma 4

paul-open-12b-it

Planned

Intermediate target. Requires an RTX 3090/4090 for 4-bit inference.

Parameters
12B
VRAM (4-bit)
~12GB
Context
8K
Architecture
Gemma 4

paul-open-26b-it

Planned

Full capability target. Requires 24GB VRAM for 4-bit, or dual cards for unquantized inference.

Parameters
26B
VRAM (4-bit)
~24GB
Context
8K
Architecture
Gemma 4

Quick Start

Reproduce the research environment locally using uv.

Quick Start — Local Development
$ git clone https://github.com/foundrypaul-cloud/paul-open.git$ cd paul-open$ uv sync --extra all$ uv run pytest