Post-training6 min
Process reward modeling: how step-level signals beat outcome-only RLHF
Aditi SharmaApril 18, 2026
RL environments9 min
Why your browser agent can't generalize: the sandbox-fidelity gap
Marcus ChenApril 11, 2026
Data quality7 min
Inter-annotator agreement is a lossy metric. Here's what we use instead.
Priya IyerApril 4, 2026
Evaluation5 min
LLM-as-judge calibration: a practitioner's checklist
David MwangiMarch 27, 2026
Industry4 min
The shift from static datasets to interactive RL gyms
Vraify ResearchMarch 21, 2026
Post-training8 min
DPO vs RLHF: when chosen/rejected pairs are enough
Aditi SharmaMarch 14, 2026