---
id: "{{benchmark-id}}"
type: evaluation
status: draft
owner: "{{ผู้ทดลอง}}"
scope: "{{workload}}"
access: "{{private / team / public}}"
last_verified: "{{วันที่}}"
evaluation_state: planned
---

# ทดลองว่า {{ระบบความรู้}} ช่วย agent ทำงานต่อได้หรือไม่

## คำถามและสมมติฐาน

- คำถาม: {{เช่น ลดคำถามซ้ำโดยไม่ลด task success ได้หรือไม่}}
- สมมติฐาน: {{ผลที่คาด ไม่ใช่ผลที่พบ}}
- เกณฑ์ที่ถือว่าคุ้ม: {{threshold ที่กำหนดก่อนทดลอง}}

## ชุดงาน

| Task ID | งานและผลที่ต้องได้ | หลักฐานที่จำเป็น | เกณฑ์ผ่าน | กลุ่ม |
|---|---|---|---|---|
| T1 | {{งาน}} | {{gold source}} | {{rubric}} | {{test}} |

ให้มีงานที่ใช้ความรู้เก่า งานที่ข้อมูลเปลี่ยน งานที่ไม่มีคำตอบ และงานที่ต้องขอการตัดสินใจใหม่ แยกงานปรับระบบออกจาก test และเก็บ rubric/gold answers นอก context ของ agent แต่ให้แหล่งข้อมูลที่ใช้งานได้อย่างเท่าเทียม

## ระบบที่เทียบ

| Arm | ความสามารถที่เพิ่ม | ข้อมูลที่เข้าถึง |
|---|---|---|
| A | ไม่มี persistent memory; อ่าน code/live tools ที่จำเป็นได้ | {{ชุดข้อมูลฐาน}} |
| B | Repo docs + file search | {{ฐาน + เอกสาร}} |
| C | Wiki + search | {{แหล่งเดียวกับ B จัดเป็น wiki}} |
| D | Knowledge/memory system | {{แหล่งเดียวกัน พร้อม memory ตามแผน}} |

ถ้าแต่ละระบบเห็นข้อมูลต่างกัน ให้รายงานว่าเป็น end-to-end comparison อย่าอ้างว่าผลต่างเกิดจาก retrieval อย่างเดียว

## ตัวแปรที่ควบคุม

- Model และรุ่น: {{ค่า}}
- Harness และ prompt: {{ค่า}}
- Tools และสิทธิ์: {{ค่า}}
- Token/time budget: {{ค่า}}
- Source snapshot: {{revision}}
- จำนวนงานและการรันซ้ำ: {{ค่า}}
- ลำดับทดลองและ cache: {{วิธีควบคุม}}
- Memory isolation: {{เริ่มใหม่ต่อ arm/run; ห้ามคำตอบรั่วข้ามการทดลอง}}

## Metrics และนิยาม

| Metric | นิยามที่ใช้คำนวณ |
|---|---|
| Task success | งานผ่าน rubric / งานทั้งหมด |
| Redundant questions | คำถามที่มีคำตอบชัดในแหล่งที่ agent เข้าถึงได้ รายงานต่อ task |
| Necessary questions missed | กรณีที่ต้องถามแต่ agent เดา / กรณีที่ต้องถามทั้งหมด |
| Stale fact errors | การใช้ข้อมูลถูกแทนที่จนผลลัพธ์ผิด รายงานจำนวนและความรุนแรง |
| Provenance accuracy | Claim ที่หลักฐานรองรับจริง / Claim ที่ตรวจตัวอย่างทั้งหมด |
| Retrieval recall | หลักฐาน gold ที่ค้นเจอ / หลักฐาน gold ทั้งหมด ระบุ top-k |
| Latency และ cost | เวลาต่อ task, tokens, tool/API cost แยก ingestion กับ runtime |
| Maintenance | เวลาคนในการ review, แก้ และอัปเดตคลัง |

เมื่อ denominator เป็นศูนย์ให้รายงาน not_applicable ห้ามตีเป็นคะแนนเต็ม แยกคำถามขอสิทธิ์ออกจากคำถามค้นข้อมูล

## ผลจริง

evaluation_state: planned / running / completed ให้เปลี่ยนเมื่อมีหลักฐาน ห้ามใส่ค่าคาดการณ์เป็นผลจริง

| Arm | Task success | คำถามซ้ำ/task | คำถามจำเป็นที่พลาด | Cost/task | เวลา/task |
|---|---|---|---|---|---|
| {{arm}} | {{ผลหรือ not_run}} | {{ค่า}} | {{ค่า}} | {{ค่า}} | {{ค่า}} |

- Raw logs และ configuration: {{links}}
- Failure examples: {{งาน + สาเหตุ + หลักฐาน}}
- ข้อจำกัด: {{จำนวนงาน domain model และสิ่งที่ควบคุมไม่ได้}}
- ข้อสรุปที่หลักฐานรองรับ: {{ข้อความ / ยังไม่มีผล}}

ก่อน publish ตรวจสูตรและนิยาม metric ด้วย Publication checklist คะแนน retrieval-only หรือ conversational QA ไม่ใช่คะแนน coding task success

