<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>Evaluation on Yonk-Labs</title><link>https://yonk.dev/tags/evaluation/</link><description>Recent content in Evaluation on Yonk-Labs</description><generator>Hugo -- gohugo.io</generator><language>en</language><copyright>© 2026 Yonk-Labs</copyright><lastBuildDate>Wed, 01 Jul 2026 00:00:00 +0000</lastBuildDate><atom:link href="https://yonk.dev/tags/evaluation/index.xml" rel="self" type="application/rss+xml"/><item><title>llm-judge</title><link>https://yonk.dev/projects/llm-judge/</link><pubDate>Wed, 01 Jul 2026 00:00:00 +0000</pubDate><guid>https://yonk.dev/projects/llm-judge/</guid><description>Portable CLI for judging RAG and LLM benchmark runs across local, OpenAI-compatible, and cloud providers — a deterministic quick mode, a paraphrase-tolerant LLM-as-judge mode, and a full per-case audit trail for every verdict.</description></item></channel></rss>