Table of contents
Open Table of contents
Pre-training GPT2
Pre-training objective
GPT2 is pre-trained with an autoregressive language modeling objective.
Given an input sentence, the model learns to predict the next token of the sentence. For example, take a document like “bóng chày là môn thể thao phổ biến nhất tại Puerto Rico và nước này có hẳn một mùa giải bóng chày chuyên nghiệp riêng được tổ chức vào mùa đông” with the bold part as the input. The prediction can be illustrated as follows:
| next token | ||||||||
|---|---|---|---|---|---|---|---|---|
| bóng | chày | |||||||
| bóng | chày | là | ||||||
| bóng | chày | là | môn | |||||
| bóng | chày | là | môn | thể | ||||
| bóng | chày | là | môn | thể | thao | |||
| bóng | chày | là | môn | thể | thao | phổ | ||
| bóng | chày | là | môn | thể | thao | phổ | biến | |
| bóng | chày | là | môn | thể | thao | phổ | biến | nhất |
So the label for the input above is: chày là môn thể thao phổ biến nhất.
Pre-training
The parameters used:
| Parameter | Value |
|---|---|
| hidden_size | |
| num_layers | |
| num_heads | |
| intermediate_size | |
| dropout | |
| seq_length | |
| activation | GELU |
| optim | AdamW |
| weight_decay | |
| lr | |
| warmup_steps | |
| batch_size | |
| max_grad_norm |
The model was trained on 50MB of text extracted from corpus.viwiki for a total of steps. It has 35M parameters. The figure below shows the model’s loss during training.

Some text generated by the model:
python gpt2/generate.py \
--model ./checkpoints/gpt2-40000.pt \
--tokenizer ./checkpoints/tokenizer.json \
--seed 42 \
--max-new-tokens 120 \
--temperature 1
result:
>> Nghiên cứu là một quá
Nghiên cứu là một quá trình tạo ra các chất hút điện ngoài sự vật chất . Có hai lĩnh vực điện xuất nhằm tạo ra các loại nguyên tử tự nhiên thù của các kim loại - kim loại . Gốc vụ có thể có các loại kim loại như hiđrua liti , Gd và các loại sulfua kim loại khác . Các chất phóng xạ khác gồm các đồng ( 90 %), 1 %, ") [ 25 ] 6H2O ( 20 % tương đương với 66 %.
Các hợp chất ở dạng O2 là hyđrô sulfit ở nhiệt độ thấp , là một trong các điều kiện quan trọng cho sự cháy cháy . Các chất này là nguồn
python gpt2/generate.py \
--model ./checkpoints/gpt2-40000.pt \
--tokenizer ./checkpoints/tokenizer.json \
--seed 42 \
--max-new-tokens 40 \
--temperature 0.5
result:
>> Đầu năm 2021
Đầu năm 2021 , một nhóm hội nghị quốc tế đã được thành lập tại Paris năm 1973 , và cuộc họp này đã được tổ chức bởi các đảng hợp nhất . Năm 1999 , Hội nghị thượng đỉnh thứ nhất được
Pre-training BERT
Pre-training objective
BERT is pre-trained on two tasks: masked language modeling (MLM) and next sentence prediction (NSP).
Pre-training
The parameters used (BERT-medium):
| Parameter | Value |
|---|---|
| hidden_size | |
| num_layers | |
| num_heads | |
| intermediate_size | |
| dropout | |
| attention_dropout | |
| pooler_dropout | |
| seq_length | |
| activation | GELU |
| optim | AdamW |
| weight_decay | |
| lr | |
| warmup_steps | |
| batch_size | |
| max_grad_norm |
The model was trained on 500MB of text from the OSCAR dataset. After processing, the dataset has about 1.4 million samples. The dataset is built as the original authors describe.
The model has about 58M parameters and trains for steps. On the test set it reaches an accuracy of on MLM and on NSP.

NSP converges quickly. MLM converges more slowly.
Example of the model’s results on [MASK] prediction:
sentence = '[CLS] Anh [MASK] là một [MASK] trai thấp [MASK] [SEP]'
>> predictions = [
{
'token': 'cũng',
'score': 0.12953687
},
{
'token': 'chàng',
'score': 0.85561085
},
{
'token': 'giọng',
'score': 0.1861668
},
]
Pre-training BART
Pre-training objective
BART is pre-trained with a denoising objective.
Pre-training
The parameters used:
| Parameter | Value |
|---|---|
| hidden_size | |
| num_layers | |
| num_heads | |
| intermediate_size | |
| dropout | |
| attention_dropout | |
| src_seq_length | |
| target_seq_length | |
| activation | GELU |
| optim | AdamW |
| weight_decay | |
| lr | |
| warmup_steps | |
| batch_size | |
| max_grad_norm | |
| beam_size |
The model was trained on 500MB of text from the OSCAR dataset, following the data processing the original authors describe. It was tested on 4 datasets with about training samples. The transforms and their ratios:
- Token masking: ratio
- Token deletion: ratio
- Text infilling: ratio
- Token masking + token deletion + text infilling: each ratio
The model has about 61M parameters and trains for steps. Some of the model’s results:

BLEU is highest with text infilling, above token masking and the combined masking + deletion + infilling. With infilling, a run of consecutive tokens is replaced by one [MASK] token, so the sentence has far fewer [MASK] tokens than the other two setups. Token deletion is the hardest for the model.

Example results with token masking:
- source: từ 2 năm trở lên bạn vẫn có thể tiến hành đăng ký biển số xe Hà [MASK] [MASK] đó nếu bạn muốn đăng [MASK] [MASK] số xe Hà Nội bạn làm Ngọ tục sang tên tại quận
- prediction: từ 2 năm trở lên bạn vẫn có thể tiến hành đăng ký biển số xe Hà Nội Do đó nếu bạn muốn đăng ký một số xe Hà Nội bạn làm thủ tục sang tên tại quận
- target: từ 2 năm trở lên bạn vẫn có thể tiến hành đăng ký biển số xe Hà Nội Theo đó nếu bạn muốn đăng ký biển số xe Hà Nội bạn làm thủ tục sang tên tại quận
Example results with token deletion:
- source: tổ hợp Vincom và phố thương mại shophouse Khu đô du lịch hỗn hợp Dinh Mười ( 28 tỷ đồng ), Khu thự nghỉ dưỡng Bảo Ninh ( 1000 tỷ đồng ) đã cho thấy giá trị thực sự ở đặc biệt là bất động sản nghỉ dưỡng Cùng với đó các mạnh sẵn có về nhiên với 116
- prediction: tổ hợp Vincom và thành phố thương mại shophouse Khu đô thị du lịch hỗn hợp Dinh Mười ( 28 tỷ đồng ), Khu biệt thự nghỉ dưỡng Bảo Ninh ( 1000 tỷ đồng ) đã cho thấy giá trị thực sự ở đặc biệt là bất động sản nghỉ dưỡng Cùng với đó , các điểm mạnh sẵn có về tự nhiên với 116 tỷ đồng
- target: tổ hợp Vincom và nhà phố thương mại shophouse , Khu đô thị du lịch hỗn hợp Dinh Mười ( 28 800 tỷ đồng ), Khu biệt thự nghỉ dưỡng Bảo Ninh Sunrise ( 1000 tỷ đồng ) đã cho thấy giá trị thực sự ở đây , đặc biệt là bất động sản nghỉ dưỡng Cùng với đó , các thế mạnh sẵn có về thiên nhiên với 116 km
Example results with text infilling:
- source: giấy phép xây dựng hầm , 8 [MASK] kế 23 căn hộ dịch vụ , hồ bơi sân thượng , đối diện bến du [MASK] giao [MASK] tiện Sổ hồng [MASK] cầy Cần tiền bán gấp nhà mặt tiền Hoàng Diệu
- prediction: giấy phép xây dựng hầm , 8 tầng , thiết kế 23 căn hộ dịch vụ , hồ bơi sân thượng , đối diện bến du lịch , giao thông thuận tiện Sổ hồng sân thượng , chợ Bến Thành - Diện tích
- target: giấy phép xây dựng hầm , 8 lầu , thiết kế 23 căn hộ dịch vụ , hồ bơi sân thượng , đối diện bến du thuyền , giao thông thuận tiện Sổ hồng chính chủ 34 tỷ Liên Cần tiền bán gấp nhà mặt tiền Hoàng Diệu