طريقة Fable: مهارات لوكلاء الذكاء الاصطناعي
تعرّف إلى ملفات مستودع fable-method، وما الذي ينتقل إلى نماذج أخرى، وكيف تقارن الأداء والتكلفة بين التنفيذ بالطريقة وبدونها على VPS واحد.
ما الذي تدّعيه طريقة Fable فعلياً
طريقة Fable هي مجموعة صغيرة من مهارات الوكيل تدوّن عادات العمل لدى نموذج واحد في إجراء مرتب، بحيث يستطيع نموذج آخر تنفيذ الإجراء نفسه. المستودع هو Sahir619/fable-method، وهو مرخّص بموجب MIT، ووصفه المختصر هو: «كيف عمل Claude Fable 5، بعد تحويل ذلك إلى مهارات يمكن لأي نموذج تشغيلها، مع تقييم يحافظ على دقتها». الجزء الثاني من هذه الجملة هو الادعاء الجدير بالاختبار.
لا يمكن لأي شخص خارج Anthropic التحقق من أن ملفاً نصياً يلتقط فعلاً طريقة تفكير نموذج محدد. لكن يمكنك التحقق بنفسك من أن نموذجاً أقل تكلفة يتصرف بشكل مختلف عندما يقرأ ذلك الملف، وذلك على VPS واحد وفي فترة بعد الظهر. هذا القياس هو محور كل ما يلي: تنفيذ المهمة نفسها مرتين، مع الطريقة وبدونها، مع احتساب استدعاءات الأدوات والتكلفة.
إذا كانت كلمة skill جديدة عليك، فابدأ بقراءة ما هي مهارة الوكيل فعلياً: مجلد يحتوي على ملف SKILL.md، ويحدد وصف frontmatter فيه متى يحمّل الوكيل المحتوى. أما النموذج الذي سُمّي المستودع باسمه، فتعرّف عليه في تكلفة Claude Fable 5 وما يجيده.
ثبّت المهارات، وثبّت الإصدار الذي تختبره
توجد طريقتان للتثبيت. داخل Claude Code، تتكوّن طريقة المكوّن الإضافي من أمرين:
/plugin marketplace add Sahir619/fable-method
/plugin install fable@fable-methodعلى VPS، عندما تريد نسخة مثبّتة على القرص، استنسخ المستودع وسجّل الخروج إلى وسم أولاً:
git clone https://github.com/Sahir619/fable-method ~/fable-method
cd ~/fable-method
git checkout v1.4.0
bash install.sh
ls ~/.claude/skillsلا يحتاج install.sh إلى sudo لأنه يكتب فقط ضمن $HOME/.claude/skills. بعد تشغيله، يعرض ls ~/.claude/skills كلاً من fable-judge وfable-loop وfable-method. تحقّق مما لا يظهر. يوفّر المستودع أربع مهارات، لكن مُثبّت shell ينسخ ثلاثاً منها، لذلك لا يحصل المستخدم المستقل على fable-domain إلا إذا نسخه يدوياً:
cp -r ~/fable-method/skills/fable-domain ~/.claude/skills/ثبّت الوسم، واكتب الوسم بجانب النتائج التي تحصل عليها. نشر هذا المستودع خمسة إصدارات بين 2026-07-06 و2026-07-15، من v1.0.0 إلى v1.4.0، وغيّر v1.4.0 الطريقة نفسها بإضافة بوابة توجيه جديدة. حتى August 2026، لا يزال v1.4.0 أحدث وسم. إذا كانت قراءة التشغيل المرجعي لنسخة من القواعد، بينما تقرأ جولة الاختبار نسخة أخرى، فلن تكون قد قست شيئاً.
ما الذي تطلبه كل واحدة من المهارات الأربع من النموذج
الملف المحوري هو skills/fable-method/SKILL.md. يحتوي على بوابتين وسبع خطوات مرقمة، وقواعده محددة بما يكفي لمناقشتها.
تأتي بوابة البساطة أولاً: نفّذ مباشرةً ومن دون إجراءات شكلية عندما يقتصر التغيير على ملف واحد، ويجري في نحو 10 أسطر أو أقل، ولا يضيف سلوكاً جديداً، وتعرف مسبقاً ما الذي يجب تغييره بدقة. ثم تأتي بوابة الملاءمة، التي توجّه الطلب وفقاً لموضع الإجابة: مصادر يمكنك فتحها، أو تقنية يجب البحث عنها أولاً، أو استنتاجك أنت، ويجب وسم الحالة الأخيرة بأنها منخفضة الثقة بدلاً من عرضها كحقيقة.
ثم تأتي الحلقة: صنّف الطلب، وحدد معيار الاكتمال، واجمع الأدلة، واتخذ القرار، ونفّذ، وتحقق، وأبلغ بالنتيجة. تنص الخطوة 2 على بدء الاستكشاف بعرض محتويات الدليل قبل اختيار الملفات، وتفضيل المصادر الأساسية على التذكر، والتوقف بعد عمليتي بحث متتاليتين لا تعيدان أي معلومات جديدة. وتنص الخطوة 4 على كتابة سطر INTENT: قبل أي تعديل، مع ذكر ما يفعله الكود، وما يتوقعه الفحص الفاشل، وما تنص عليه المواصفة، وعلى عدم إجراء أي تعديل عندما تختلف هذه العناصر الثلاثة، لأن الاختلاف نفسه هو النتيجة المهمة. وتضع الخطوة 5 حداً لعمليات إعادة المحاولة: بعد 3 دورات فاشلة من الإصلاح والتحقق للمشكلة نفسها، توقف وأعد النتيجة مع المخرجات الفعلية.
أكثر أجزاء الملف قابلية للاختبار هي رموز التقارير الأربعة. يجب أن يتضمن تغيير السلوك سطر INTENT:. ويجب أن يتضمن الإجراء الموجّه إلى الخارج AUTH: user said "<exact words>" مع اقتباس المستخدم، لأن المستودع يوضح صراحةً أن التوثيق لا يمثل تفويضاً. ويجب أن يتضمن الإجراء الموصى به الذي لم يُنفّذ سطر PENDING:. أما العيب الذي جرى إصلاحه فيتطلب TWINS: searched <pattern> - found <N> other sites. لا تحتاج إلى الوثوق بأي شيء يتعلق بالمنهج كي تتحقق من ظهور هذه السلاسل الأربع عندما تكون مطلوبة، وهذا ما يجعل العملية قابلة للقياس بدلاً من اعتمادها على الانطباعات.
إن fable-loop هو المنهج نفسه، لكنه يُشغَّل كتنسيق من 4 مراحل: التخطيط باستخدام وكلاء فرعيين متوازيين لجمع الأدلة، والتنفيذ في المسار الرئيسي، والتحقق باستخدام وكيل فرعي واحد إلى 3 وكلاء فرعيين مهاجمين، يتخذ كل منهم منظوراً مختلفاً، ثم التدقيق وإعداد التقرير. ويفترض استخدام نماذج منخفضة التكلفة في أدوار جمع الأدلة والهجوم، ونموذج أقوى لاتخاذ القرارات وإجراء التعديلات.
أما fable-judge فهو الجزء الذي يستحق التثبيت حتى إذا تخلّيت عن بقية الأجزاء. ومنطلقه هو أن «التقرير مجموعة من الادعاءات، وليس دليلاً». يجمع الادعاءات من التقرير المكتمل، ويحدد الحقيقة الفعلية من git diff وgit status، ويعيد تنفيذ كل عملية تحقق يذكر التقرير أنه أجراها، ويبحث عن قائمة محددة من أساليب الاحتيال: إضعاف عمليات الفحص، والإكمال الزائف، وتوسيع النطاق، والإجراء غير المصرح به، ومخالفة المواصفة، والمخلفات المتبقية. ويُرجع إحدى النتائج التالية: VERIFIED أو VERIFIED WITH CAVEATS أو REFUTED، ويضع وسم UNVERIFIABLE لأي شيء لا يمكنه إعادة إنتاجه بدلاً من افتراض نجاحه. وتشير الجملة الختامية الخاصة بالمثبت إليه مباشرةً: «جرّبه: افتح Claude Code واكتب /fable-judge بعد أن يزعم أي وكيل أن العمل اكتمل».
ينشئ fable-domain حزم محولات للمجالات، مع تركيبات اختبار للفخاخ واختبارات تقييم أولية. تتضمن الحزمة 8 محولات: التسويق، والبحث، وتحليل البيانات، والأعمال والعمليات، والتمويل، والشؤون القانونية والامتثال، والتصميم وتجربة المستخدم، وdevops. أما العمل الطبي والسريري، فقد تُرك عمداً من دون محول.
الأجزاء التي يمكن نقلها إلى نموذج آخر، والأجزاء التي لا يمكن نقلها
يجيب المستودع عن ذلك مباشرةً في AGENTS.md، الذي يبدأ بالنص التالي: "إصدار محمول لأي وكيل أو بيئة تشغيل للبرمجة (Codex وCursor وaider وsystem prompt خام). الطريقة مطابقة لـSKILL.md؛ ألصق هذا الملف في تعليمات وكيلك أو ضعه في جذر المستودع باسم AGENTS.md." يبلغ طول الملف نحو 2,600 كلمة، ويحمل البوابات والخطوات والأوضاع نفسها. إذا كنت تحتفظ بملفات تعليمات في جذر المستودع، فإن اصطلاح AGENTS.md وHUMAN.md يوضح مكان وضع الملف ومن يقرأه.
يمكن نقل جزأين دون تعديل كبير. نص الطريقة عبارة عن prompt مرتب لا يتضمن أي تعليمات خاصة بنموذج محدد، لذلك يمكن لأي نموذج يتبع التعليمات تنفيذها. وتتمثل أطروحة المستودع في أن مقدار العمل المطلوب يتناسب عكسياً مع مستوى النموذج. ويمكن نقل آلية التقييم أيضاً، ما دام لدى الوكيل shell ومستودع، لأن كل ما تنفذه هو git diff مع إعادة تشغيل الأوامر التي يستطيع القارئ تشغيلها أيضاً.
لا يمكن نقل جزء واحد دون تعديل كبير. يفترض fable-loop أن بيئة التشغيل تستطيع إنشاء subagents متوازية وتوجيهها إلى نماذج مختلفة. يشغّل الوكيل الذي لا يدعم subagents تلك المراحل بالتتابع على نموذج واحد، ما يلغي التوازي ووفر التكلفة اللذين يبرران التصميم. وما يتبقى هو fable-method مع مفردات إضافية.
هناك أمران أصغر مرتبطان ببيئة التشغيل وقد يسهل إغفالهما. مشغّل /fable-method هو أمر slash في Claude Code، لذلك تستدعي الطريقة في بيئة تشغيل أخرى من خلال وصفها. أما وصف frontmatter في SKILL.md فهو ما يتيح للوكيل تحميل المحتوى فقط عندما يطابق المهمة، ما يعني أن تثبيت skill لا يكلّف شيئاً تقريباً قبل تشغيلها. إذا ألصقت AGENTS.md في system prompt بدلاً من ذلك، فستُرسل تلك الـ2,600 كلمة مع كل طلب ترسله، سواء كانت المهمة إصلاح خطأ مطبعي في سطر واحد أو إعادة هيكلة. هذا فرق حقيقي في التكلفة، وهو السبب الأكبر تقريباً لوجود حزمة skill من الأساس.
كيفية إجراء اختبار A/B على VPS: المهمة نفسها مرتين
أنشئ نسختين عاملتين متطابقتين حتى لا تتمكن أي من العمليتين من رؤية تعديلات الأخرى. استبدل YOUR_ORG/YOUR_REPO بالمستودع الذي تريد اختباره؛ ويجب أن تأتي النسختان من الالتزام نفسه.
sudo apt update && sudo apt install -y git jq
git clone https://github.com/YOUR_ORG/YOUR_REPO ~/ab/control
git clone https://github.com/YOUR_ORG/YOUR_REPO ~/ab/methodاختر مهمة يمكنك ملاحظة نتيجتها دون اعتماد على الرأي: اختبار فاشل يجب أن ينجح، أو script يجب أن ينتهي برمز خروج 0. تؤدي المهمة الغامضة إلى مقارنة غامضة، لأنك ستقيّم النص بدلاً من النتائج.
شغّل ذراع التحكم باستخدام --bare، الذي يتجاوز الاكتشاف التلقائي لـ hooks وskills وplugins وCLAUDE.md. هذا الخيار هو ما يجعله اختباراً ضابطاً: فلا يمكن للـskills التي ثبّتها سابقاً أن تتسرّب إليه. لا يستخدم الوضع المجرد تسجيل الدخول الخاص باشتراكك، لذلك اضبط API key من Claude Console أولاً.
export ANTHROPIC_API_KEY=sk-ant-...
task="Make tests/test_parser.py pass without editing the test file."
cd ~/ab/control
claude --bare -p "$task" \
--allowedTools "Read,Edit,Bash" \
--output-format stream-json --verbose > ~/ab/control.jsonlذراع الطريقة هو الأمر نفسه مع إضافة خيار واحد، ما يحمّل الطريقة المحمولة كإضافة إلى system prompt:
cd ~/ab/method
claude --bare -p "$task" \
--append-system-prompt-file ~/fable-method/AGENTS.md \
--allowedTools "Read,Edit,Bash" \
--output-format stream-json --verbose > ~/ab/method.jsonlالملف التنفيذي نفسه، والنموذج نفسه، والأدوات نفسها، وشجرة البداية نفسها. يختلف خيار واحد فقط، وهذه هي الطريقة الوحيدة التي تجعل المقارنة ذات معنى.
يقيس هذا التصميم نص الطريقة. ولا يقيس حزمة الـskill، فهذه مسألة منفصلة. لقياس الحزمة، احذف --bare، وثبّت الـskills كما سبق، وضع اسم الـskill داخل سلسلة prompt، لأن الـskills التي يستدعيها المستخدم تُوسَّع في وضع الطباعة: claude -p "/fable-method $task". توقّع أن يختلف نمط التكلفة عن ذراع system prompt حتى عندما يبدو السلوك المرئي متطابقاً.
حساب الخطوات والتكلفة
أنتج كلا التشغيلين تدفقاً من أحداث JSON. السطر الأخير هو رسالة result تحمل النص النهائي والتكلفة والبيانات الوصفية للجلسة. اطبع هذا السطر مرة واحدة واقرأه قبل أن تكتب أي نصوص برمجية تعتمد عليه، لأن أسماء الحقول تتغير بين إصدارات Claude Code.
tail -1 ~/ab/control.jsonl | jq .تأتي تكلفة كل تشغيل من ذلك السطر، وهي الرقم الذي يجب مقارنته:
for f in ~/ab/control.jsonl ~/ab/method.jsonl; do
printf '%s ' "$f"
jq -r 'select(.type=="result") | .total_cost_usd' "$f"
doneتأتي الخطوات المنفذة من عدّ استدعاءات الأدوات في الملف نفسه:
jq -r 'select(.type=="assistant") | .message.content[]? | select(.type=="tool_use") | .name' \
~/ab/control.jsonl | sort | uniq -c | sort -rnنفّذ ذلك على كلا الملفين. يخبرك شكل الفرق أكثر من الإجماليات. إذا كان تشغيل الطريقة يقرأ ملفات أكثر ويجري تعديلات أقل، فهو ينفذ ما تطلبه الطريقة، وهذه هي المقايضة التي تدفع مقابلها. أما إذا أجرى تشغيل الطريقة التعديلات نفسها بتكلفة أعلى بنسبة أربعين بالمائة، فلم تحصل على فائدة في تلك المهمة.
انتبه إلى أمرين بشأن الأرقام. أولاً، لا تجمع output_tokens من نصوص الجلسات ضمن ~/.claude/projects/ وتعتبر الناتج الإجمالي؛ فكتل الاستخدام لكل رسالة هي لقطات مأخوذة أثناء البث، وهناك تقارير مفتوحة تفيد بأنها تحسب قيمة أقل من الفعلية. الرقم الذي يجب الوثوق به هو السطر result. ثانياً، يُعد تشغيل واحد لكل ذراع تجربة محدودة، لذلك شغّل كل ذراع ثلاث أو أربع مرات على المهمة نفسها قبل أن تثق بوجود فرق، لأن تشغيلين للوكيل نفسه على المهمة نفسها يختلفان بالفعل عن بعضهما. وللحصول على رؤية أطول للإنفاق، تشرح الأدوات التي تتتبع إنفاق Claude Code وطريقة احتساب Claude Code للرموز سبب هيمنة أسطر ذاكرة التخزين المؤقت على الأعداد الأولية.
تأكد من أن الوكيل لا يستطيع الوصول إلى أي شيء مهم بالنسبة إليك أثناء تشغيله دون مراقبة. يوضح تشغيل Claude Code بأمان على VPS حساب المستخدم ورايات الأذونات.
تقييم المستودع نفسه، بقراءة صادقة
عنوان README هو: «15 جولة تقييم، وأكثر من 260 عملية تشغيل للوكلاء، وحكّام LLM عميان يتحققون عبر المقارنة بالفروقات والتنفيذ». هذه أدلة أكثر مما تنشره معظم مستودعات المهارات، كما أن eval/RESULTS.md موثّق جولةً بعد جولة، مع إبقاء حالات الفشل. لكنه أضيق مما يوحي به الرقم الوارد في العنوان عند النظر إلى الخلايا الفردية التي تقف وراء صفوف العنوان.
The data behind this chart
[
{
"label": "Haiku, spec-vs-test conflict trap",
"runs": 4,
"notes": "bare 0 of 4, with method 4 of 4"
},
{
"label": "Sonnet, same conflict trap",
"runs": 2,
"notes": "bare flags it then sides with the wrong test, with method ideal action both runs"
},
{
"label": "Haiku, planted-fraud report, fable-judge",
"runs": 2,
"notes": "bare 4 and 3 of 5 frauds caught, with method 5 of 5 both runs"
},
{
"label": "Haiku, marketing brand-rules trap",
"runs": 2,
"notes": "bare 1 of 2 runs, with method 2 of 2"
}
]يعتمد أكبر عدد من هذه الصفوف، وعددها 4، على 4 عمليات تشغيل. أما الصفوف الثلاثة الأخرى فيعتمد كل منها على 2 عمليات تشغيل. ويذكر المستودع ذلك صراحةً في القيود الثابتة أعلى السجل: «عدد العينات صغير في كل المواضع (من 1 إلى 4 عمليات تشغيل لكل خلية)، وحكّام LLM (عميان عند مقارنة مخرجات متعددة، لكنهم مبنيون على النموذج الحدّي نفسه الذي يظهر كخط أساس)، وتركيبات اختبار اصطناعية، وحقيقة أرضية بحثية لا تتجاوز حداثتها تاريخ تشغيلها». ويقول أيضاً بصورة أكثر مباشرة: «يوجد هذا السجل لاختبار تعديلات المنهج، وليس لكي يخلطه أحد بالمعيار المرجعي».
يُحسب ذلك للمؤلف. فالمؤلف الذي ينشر قيمة n الخاصة به، ويسمي المشكلة المتمثلة في بناء الحَكَم على النموذج نفسه المستخدم كخط أساس، أكثر صدقاً من المعتاد في هذه الفئة. اقرأ الأرقام باعتبارها دليلاً على أن المؤلف شغّل الاختبارات فعلاً واحتفظ بحالات الفشل. أما اختبار A/B الخاص بك فهو الذي يوضح لك ما يحدث في قاعدة التعليمات البرمجية لديك.
يوضح README بالقدر نفسه الحالات التي لا يضيف فيها المنهج شيئاً، وهذه أكثر فقراته فائدة. فهو لا يسجل أي تحسن في المهام الصغيرة العادية عند استخدام نماذج قادرة. ويذكر أن «المنهج لا يستطيع جعل حقائق النموذج أحدث؛ وتتفوق النماذج الحدّية في الأبحاث التي تتطلب معرفة واسعة». كما يحدد موضع القيمة في «الحالات الخادعة (تعارضات السلطة، وادعاءات الإنجاز الزائفة، والمنفّذون الضعفاء، وعمليات التشغيل غير المراقبة)، وليس في كل الحالات». إذا كان عمل وكيلك يقتصر على تعديلات صغيرة في نموذج قوي مع مراقبتك له، فتوقع ألا تقيس أي فرق إطلاقاً. أما إذا كان نموذج أرخص يعمل دون مراقبة، فهناك يُفترض أن يظهر الفرق، وهذا يجعل الاختيار بين Opus وSonnet وHaiku جزءاً من القرار نفسه.
حيث تصبح عملية الحزم ممارسة آلية بلا فحص
توجد أربعة انتقادات تستحق الذكر، ولا يبرر أيٌّ منها تجاهل المستودع.
يتجاوز التأطير الأدلة المتاحة. عبارة «كيف عمل Claude Fable 5» ادعاء بشأن البنية الداخلية لنموذج لا يستطيع أحد خارج Anthropic التحقق منه، كما أن الجملة المحورية في المستودع نفسه تضعف هذا الادعاء: «تكمن الجودة في البنية والأدلة والصدق، لا في النموذج». إذا كانت الجودة تكمن في البنية، فإن قصة المصدر مجرد إضافة شكلية. الإجراء قائم بذاته ولا يحتاج إلى قصة نشأة أسطورية.
تتجاوز المهارات الأربع ما يحتاج إليه المحتوى من حيث الشكل. تعيد fable-loop صياغة جزء كبير من fable-method مع إضافة طبقة تنسيق حوله، وفي بيئة لا تتضمن subagents تختزل في النهاية إلى fable-method. اقرأ الملفين جنباً إلى جنب قبل تثبيتهما معاً.
توفّر محولات المجالات الثمانية اتساعاً لا يغطيه التقييم. يظهر اثنان فقط من المحولات الثمانية في السجل: التسويق في الجولة 9 وdevops في الجولة 12. أما محولات finance وlegal وdesign وdata فتأتي من دون أي جولة مرتبطة بها. قد يكون المحول الخاص بمجالك جيداً رغم ذلك. لكنه يظل مسودة من المؤلف، وليس شيئاً صمد أمام fixture اختبار مصمم لكشف الأخطاء.
كما أن أداة التثبيت تختلف مع المستودع بشأن ما يوفّره، إذ تنسخ ثلاث مهارات من أصل أربع إلى ~/.claude/skills. هذه فجوة صغيرة. لكنها أيضاً من النوع الذي يخبرك بأن عملية الحزم تقدمت أسرع من مراجعتها، وهو أمر يستحق التذكر عند تحديد مقدار ما ستعتمده دفعة واحدة.
ما ينبغي الإبقاء عليه إذا لم تُبقِ على أي شيء آخر
أزل العلامة التجارية، وستبقى أربع قواعد قائمة بذاتها، أيّاً كان الوكيل الذي تستخدمه.
- اقتباس التفويض. يتطلب الإجراء غير القابل للعكس أو الموجّه إلى الخارج كلمات المستخدم نفسه، مكتوبة في سطر `
AUTH:`. الوكيل الذي لا يستطيع العثور على اقتباس لا ينفّذ الإجراء. - الفحص المزدوج. بعد إصلاح عيب، ابحث في المشروع بأكمله عن البنية الخاطئة نفسها، وأبلغ عن العدد، بما في ذلك عندما يكون العدد صفراً.
- التحقق بالملاحظة. يُعد الفحص الأخضر المحدد الذي يعمل فوق بنية معطّلة عملية تحقق فاشلة، وليس نجاحاً.
- إعداد التقارير بدءاً من النتيجة، مع ذكر ما جرى تخطيه أو ما بقي من دون تحقق باعتباره تحفظاً، بدلاً من إسقاطه بصمت.
لا تكلّفك هذه القواعد الأربع شيئاً لاعتمادها، ويمكنك استخدام grep للتحقق من الالتزام بها. ابدأ من هنا، وقِس النتائج باستخدام الـharness أعلاه، ثم قرر ما إذا كان باقي المستودع يستحق حصته من ميزانية السياق. إذا أردت تزويد الوكيل بسياق ثابت للمشروع بدلاً من طريقة عمل، فإن ملف DESIGN.md الذي يقرأه الوكلاء قبل إجراء التعديلات هو الخطوة المكملة.
FAQ
هل تعمل طريقة Fable مع نماذج غير Claude؟
نعم، يعمل نص الطريقة. فهو prompt مرتب لا يتضمن code خاصاً بنموذج معين، ويصدر المستودع AGENTS.md كنسخة قابلة للنقل إلى Codex أو Cursor أو aider أو system prompt خام. لكن هناك عنصران لا ينتقلان. إن /fable-method و/fable-judge هما أوامر slash خاصة بـClaude Code، لذلك تستدعي الطريقة في البيئات الأخرى عبر وصفها. أما fable-loop فيفترض وجود harness قادر على تشغيل subagents متوازية على نماذج مختلفة؛ ومن دونه تعمل الطريقة بالتتابع وتمنحك fable-method مع خطوات إضافية.
هل يؤدي تشغيل هذه المهارات إلى استهلاك عدد أكبر من الرموز؟
نعم، ويعتمد المقدار على طريقة تحميلها. عند تثبيتها كمهارات، لا يتم تحميل المحتوى إلا عندما يتطابق الوصف مع المهمة، لذلك لا يستهلك الطلب غير المرتبط بها شيئاً تقريباً. أما عند لصقها في system prompt، فإن نحو 2,600 كلمة من AGENTS.md تُرفق مع كل طلب. كما يستهلك التنفيذ نفسه رموزاً أكثر، لأن الطريقة تطلب الفهم الأولي قبل التعديل، والأدلة قبل اتخاذ القرار، والتحقق الفعلي بعد ذلك. قِس الأمر بنفسك: نفّذ المهمة نفسها باستخدام --output-format json في الذراعين، ثم قارن الحقل total_cost_usd.
ما إصدار fable-method الذي ينبغي أن أثبّته، ولماذا يجب تثبيت الإصدار؟
شغّل git checkout v1.4.0 قبل التثبيت. تعود تلك الوسمة إلى 2026-07-15، وكانت لا تزال الأحدث في أغسطس 2026. نشر المستودع خمسة إصدارات خلال الأيام التسعة السابقة، وغيّر v1.4.0 قواعد التوجيه نفسها. إذا تابعت main أثناء القياس، فقد يقرأ التشغيل الضابط والتشغيل الاختباري تعليمات مختلفة، ما يجعل المقارنة بلا قيمة. سجّل الوسمة إلى جانب نتائجك.
هل يمثل eval الموجود في المستودع اختباراً معيارياً يمكنني الوثوق به؟
تعامل معه كسجل تغييرات للطريقة، فهذا هو الوصف الذي يستخدمه مؤلفه: "يوجد هذا السجل حتى تُختبر تعديلات الطريقة، لا حتى يخطئ أحد في اعتباره اختباراً معيارياً." وترد القيود في أعلى الملف: من 1 إلى 4 عمليات تشغيل لكل خلية، وfixtures اصطناعية، وحكّام LLM مبنيون على النموذج المتقدم نفسه الذي يعمل أيضاً كخط أساس. الجولات حقيقية، كما أن التجارب الفاشلة محفوظة، وهذا أكثر مما تنشره معظم المستودعات. لكنه لا يزال لا يقيس ما سيحدث في قاعدة الشيفرة لديك، لذلك نفّذ مقارنة الذراعين بنفسك.