Kto tu jest "dobrym pieskiem"? Kategorie Evals, czyli jak oceniać jakość modeli LLM
AI Testers • Odc. 2 • lip 2026
Dlaczego klasyczne asercje zawodzą przy modelach językowych? Poznaj trzy filary Evals — Fidelity, Relevance i Tone & Format — i dowiedz się, jak mierzyć jakość odpowiedzi AI poprawnie.
Dlaczego AI nie słucha komend jak pies? Walka z niedeterministycznością w testach LLM
AI Testers • Odc. 1 • lip 2026
Pierwszy odcinek serii AI Testers: dlaczego testowanie LLM-ów to nie to samo co testowanie klasycznego oprogramowania i jak radzić sobie z niedeterministycznością.
O testowaniu asystenta AI, pracy w InPost i nowych kierunkach QA
Testing Station • S03E01 • maj 2026
Prowadzący: Arkadiusz Jelonek
Rozmowa o testowaniu asystenta AI InPost: human-in-the-loop, golden set, guardrails, LLM-as-a-judge i przyszłości roli QA.