Aleph Alpha
Research

Aleph Alpha Blog

T-Free: Hierarchical Autoregressive Transformers for Language Fairness and Sovereignty

A game-changer for low-resource languages and out-of-distribution fine-tuning

Subword Tokenizers and Their Problems

Hierarchical Autoregressive Transformers

Pre-training

Table 1: Model Performance After Pre-training
Llama-3.1-8B Apple-DCLM-7B Meta BLT-Entropy-8B* HAT-7B (pre-trained)
Pre-training DataProprietary (>15T token)DCLM-Baseline + Math + Code (2.5T Token)Proprietary (1T token equivalent)DCLM-Baseline (2.3T token equivalent)
Bytes per token/word4.564.354.55.28
MMLU (5-shot)0.6560.620.5740.594
ARC challenge (25-shot)0.5830.6020.5210.613
GPQA (1-shot)0.2920.319-0.279
HellaSwag (10-shot)0.8150.8120.8060.815
Winogrande (5-shot)0.690.691-0.7

Let’s Learn Finnish!

Continued Pre-training

Table 2: Model Performance after Finnish Continued Pre-training
Eval Task Llama-3.1-8B Viking-7B Apple-DCLM-7B (CPT'ed) HAT-7B (CPT'ed)
ARC-Fin (25-shot)0.3870.3550.4710.453
MMLU-Fin (5-shot)0.4830.2620.5080.443
FinBench Classification (3-shot)0.6350.5840.6070.663
FinBench OpenQA (3-shot)0.5950.4340.6220.572
FinBench Reasoning (3-shot)0.6360.5550.6770.578
FinBench Math (3-shot)0.8070.2690.5430.374

Instruction Finetuning

Table 3: Model Performance after Finnish Instruction Finetuning
Eval Task Apple-DCLM-7B (finetuned) HAT-7B (finetuned)
MT-Bench Fin (single judgement)2.722.98
Finnstructable* avg0.5540.684
Finnstructable grammar0.880.96
Finnstructable quality0.10.35

Inference Efficiency

Apple-DCLM-7B HAT-7B
EN: Bytes per token/word4.355.28
FIN: Bytes per token/word2.687.96

Robustness

Conclusion

More blog posts