التكلفة / COST
يقرأ الإدخال نفسه بتكلفة أقل.
مثال: تكلفة إدخال cache hit تساوي 10% من الإدخال العادي
حتى مع النموذج نفسه، قد تختلف التكلفة والسرعة كثيرًا.
يكمن السر فيتجميد بداية الطلب.
تبقى البداية كما هي، وتُضاف المعلومات الجديدة في النهاية فقط.
* مثال من الأسعار الرسمية لـ GPT-5.6 وClaude وGemini · † أعلى قيمة في دراسة arXiv شملت 500 جلسة؛ بعض الاستراتيجيات لم تتحسن أو كانت أبطأ
الآلية / THE MECHANISM
ذاكرة الموجّه والسياق لا تحفظ الإجابة نفسها. في مرحلة prefill يعيد المزوّد استخدام حسابات البادئة المتطابقة. وعندما تكون صالحة، لا يلزم سوى قراءة الذيل الجديد.
يقرأ الإدخال كاملًا وينشئ الحالة الحسابية.
يتجاوز إعادة حساب البداية نفسها.
يولّد الإجابة رمزًا تلو الآخر.
تقلّل الذاكرة المخبأة أساسًا من prefill الإدخال. أما تكلفة الإخراج وسرعة التوليد فأمران منفصلان.
INTERACTIVE LAB 01
يتغيّر الجزء القابل لإعادة الاستخدام بحسب موضع التغيير.
يعيد استخدام الكتل الثلاث الأولى كما هي.
في ذاكرة البادئة المخبأة المعتادة، يقل الجزء القابل لإعادة الاستخدام بعد موضع التغيير.
الأثر / WHY IT MATTERS
تختلف الشروط والفوائد بحسب المزوّد والنموذج. وتمثل 90% سعر إدخال تمثيليًا، لا خفض التكلفة الإجمالية للطلب.
التكلفة / COST
مثال: تكلفة إدخال cache hit تساوي 10% من الإدخال العادي
السرعة / SPEED
يختلف التحسن بحسب طول البادئة والبنية التحتية
معدل الإنجاز / THROUGHPUT
تستبعد Claude رموز قراءة الذاكرة من ITPM في معظم النماذج
INTERACTIVE LAB 02
يفترض هذا النموذج أن القراءة تكلف 10% من الإدخال العادي. ولا يشمل الكتابة أو التخزين (TTL) أو الإخراج.
عبء الإدخال الفعلي لكل جولة محسوبًا بالسعر الكامل
مؤشر تكلفة الإدخال28 / 100
نسبة التوفير التقريبية72%
حتى مع معدل إصابة أعلى، يؤدي السياق الضخم إلى عبء أكبر بنحو 5.7×.
سجلات استخدامنا لـ Orca
ORCA HQ · 2026.07.20—07.27 · LOCAL USAGE LOG
حلّلنا 207 جلسات أمكن التحقق من مساراتها في سجلات HQ التي جمعها Orca محليًا. الأرقام هي مجموع حقول usage؛ ولم نقدّر التكلفة لغياب سجلات الفوترة.
WHAT THE LOG SHOWS
من إجمالي 2.201 مليار رمز، كان 2.161 مليار cache read و38.82 مليون cache write و799 ألف إدخال جديد.
قراءة الذاكرةمن السجلات
2.161 مليار98.20%كتابة الذاكرةمن السجلات
38.82 مليون1.76%إدخال جديدمن السجلات
799 ألف0.04%إعادة استخدام مرتفعة وسياق مطلق كبير
THREE REAL RUNS
جميعها عمليات benchmark في Orca باستخدام Claude Opus 5، وقد قُرّبت المجاميع.
ملاحظة: كانت القراءة أكبر من الكتابة بنحو 460 مرة.
ملاحظة: أُعيد استخدام معظم رموز الإدخال.
ملاحظة: أظهرت المهام الطويلة نسبة إعادة استخدام مرتفعة أيضًا.
تشترك العمليات الثلاث في تنفيذ مهام ذات الهدف نفسه تباعًا خلال وقت قصير وفي جلسة واحدة.
تنبيه: هذا ارتباط قوي، لكنه لا يصنف مباشرة سبب كل عملية كتابة.التطبيق / THE PLAYBOOK
يعتمد تحسين الذاكرة على كيفية بدء الجلسة ومواصلتها وتنظيمها.
روبوت محادثة عام / PRESCRIPTION
رتّب الوصف والمواد مرة واحدة في البداية.
واصل المهمة نفسها في السلسلة نفسها.
اذكر فقط تغييرات المستندات الطويلة.
CACHE & CONTEXT HABITS
WHAT TO MEASURE
هل تحدث الإصابة فعلًا؟
هل أصبحت الجلسة ثقيلة جدًا؟
كم تكلف كل نتيجة؟
هل يصل أول رمز أسرع؟
خط الأساس واتجاه حمل عملك أهم من معدل مثالي يفترض أنه يناسب الجميع.
رأي GPT / A MODEL'S TAKE
تحسين الذاكرة المخبأةليس حيلة في صياغة الموجّه،بل هو تصميم لبنية المعلومات.
معدل الإصابة مفيد، لكن 100% ليس الهدف. أعد استخدام الحقائق الثابتة واقرأ من جديد ما تحتاجه الآن فقط.
إذا تعارضت الذاكرة مع حداثة المعلومات أو دقتها، فامنح الدقة الأولوية.
فحص من 30 ثانية
YOUR NEXT SESSION
كل بند مكتمل يجعل الجلسة أخف.
ONE LINE TO REMEMBER
نسبة التوفير = معدل الإصابة × (1 − تكلفة القراءة / تكلفة الإدخال العادي). عند 10% و80% إصابة، تنخفض تكلفة الإدخال نحو 72%.
لا. تختلف TTL والحدود الدنيا والخصومات وحقول usage بحسب المزوّد والنموذج.
لا. يعتمد الأمر على سياسات المزوّد وTTL وإدارة السياق الداخلية.
قارنّا الوثائق الرسمية والدراسة الأصلية كما في 13 أغسطس 2026، وأعدنا تجميع أرقام Orca من سجلات usage المحلية.