استخدام الذكاء الاصطناعيISSUE 07

إصابة الذاكرة المخبأة
الدليل الشامل

حتى مع النموذج نفسه، قد تختلف التكلفة والسرعة كثيرًا.
يكمن السر فيتجميد بداية الطلب.

REQUEST / 0042LIVE
01تعريفات الأدواتثابت
02تعليمات النظامثابت
03المستند المرجعيثابت
CACHE BOUNDARY
04السؤال الحاليمتغيّر
05أحدث نتيجةمتغيّر

تبقى البداية كما هي، وتُضاف المعلومات الجديدة في النهاية فقط.

تكلفة قراءة الذاكرةمثال: 90%↓*
أقصى تحسّن في TTFT31%↓
المبدأ الأساسيالبداية ثابتة والنهاية متغيّرة

* مثال من الأسعار الرسمية لـ GPT-5.6 وClaude وGemini · † أعلى قيمة في دراسة arXiv شملت 500 جلسة؛ بعض الاستراتيجيات لم تتحسن أو كانت أبطأ

01

الآلية / THE MECHANISM

الذكاء الاصطناعي لا يتذكّر الإجابة؛
بل يعيد استخدام حسابات البداية نفسها.

ذاكرة الموجّه والسياق لا تحفظ الإجابة نفسها. في مرحلة prefill يعيد المزوّد استخدام حسابات البادئة المتطابقة. وعندما تكون صالحة، لا يلزم سوى قراءة الذيل الجديد.

01Prefill

يقرأ الإدخال كاملًا وينشئ الحالة الحسابية.

02إعادة استخدام الذاكرة

يتجاوز إعادة حساب البداية نفسها.

03فك الترميز

يولّد الإجابة رمزًا تلو الآخر.

الخلاصة

تقلّل الذاكرة المخبأة أساسًا من prefill الإدخال. أما تكلفة الإخراج وسرعة التوليد فأمران منفصلان.

INTERACTIVE LAB 01

جرّب كسر الذاكرة المخبأة.

يتغيّر الجزء القابل لإعادة الاستخدام بحسب موضع التغيير.

SIMULATIONتدفّق جيد: 3/5
01تعريفات الأدواتHIT
02تعليمات النظامHIT
03المستند المرجعيHIT
04السؤال الحاليNEW
05أحدث نتيجةNEW

يعيد استخدام الكتل الثلاث الأولى كما هي.

في ذاكرة البادئة المخبأة المعتادة، يقل الجزء القابل لإعادة الاستخدام بعد موضع التغيير.

02

الأثر / WHY IT MATTERS

التكلفة والسرعة ومعدل الإنجاز. إصابة واحدة تغيّر الثلاثة.

تختلف الشروط والفوائد بحسب المزوّد والنموذج. وتمثل 90% سعر إدخال تمثيليًا، لا خفض التكلفة الإجمالية للطلب.

A

التكلفة / COST

يقرأ الإدخال نفسه بتكلفة أقل.

90%↓

مثال: تكلفة إدخال cache hit تساوي 10% من الإدخال العادي

B

السرعة / SPEED

بتجاوز prefill طويل، يصل أول رمز أسرع.

TTFT↓

يختلف التحسن بحسب طول البادئة والبنية التحتية

C

معدل الإنجاز / THROUGHPUT

أنجز عملًا أكثر بالميزانية والوقت نفسيهما.

×MORE

تستبعد Claude رموز قراءة الذاكرة من ITPM في معظم النماذج

INTERACTIVE LAB 02

معدل الإصابة وحده لا يكشف سوى نصف الصورة.

يفترض هذا النموذج أن القراءة تكلف 10% من الإدخال العادي. ولا يشمل الكتابة أو التخزين (TTL) أو الإخراج.

RESULT / PER TURN
56K

عبء الإدخال الفعلي لكل جولة محسوبًا بالسعر الكامل

مؤشر تكلفة الإدخال28 / 100

نسبة التوفير التقريبية72%

98% HIT900K × 0.118 = 106.2K
VS
70% HIT50K × 0.37 = 18.5K

حتى مع معدل إصابة أعلى، يؤدي السياق الضخم إلى عبء أكبر بنحو 5.7×.

CASE

سجلات استخدامنا لـ Orca

ORCA HQ · 2026.07.20—07.27 · LOCAL USAGE LOG

وجدنا في سجلاتنا نمطًا يُبقي الذاكرة المخبأة فعّالة.

حلّلنا 207 جلسات أمكن التحقق من مساراتها في سجلات HQ التي جمعها Orca محليًا. الأرقام هي مجموع حقول usage؛ ولم نقدّر التكلفة لغياب سجلات الفوترة.

فترة الرصدمن السجلات
8 أيام
20–27 يوليو
جلسات Orcaمن السجلات
207
تحقق مباشر من مسارات HQ
الاستجابات المسجلةمن السجلات
12,554
مع usage
النماذج المستخدمةمن السجلات
8
Claude وGLM وDeepSeek

WHAT THE LOG SHOWS

حصة قراءة الذاكرة المخبأة من إجمالي رموز الإدخال

من إجمالي 2.201 مليار رمز، كان 2.161 مليار cache read و38.82 مليون cache write و799 ألف إدخال جديد.

من السجلاتcache read ÷ (read + write + fresh input)

قراءة الذاكرةمن السجلات

2.161 مليار98.20%

كتابة الذاكرةمن السجلات

38.82 مليون1.76%

إدخال جديدمن السجلات

799 ألف0.04%
المتوسط لكل جولة172 ألف cache-read tokens

إعادة استخدام مرتفعة وسياق مطلق كبير

THREE REAL RUNS

في عمليات استمرت نحو ساعة، سُجلت قراءات عبر مئات الاستجابات.

جميعها عمليات benchmark في Orca باستخدام Claude Opus 5، وقد قُرّبت المجاميع.

01 · مراجعة مستندات التشغيلOPSREV3

615جولة

مدة التنفيذ
57 دقيقة
قراءة الذاكرة
137.1 مليون
كتابة الذاكرة
298 ألف
نسبة القراءة
99.78%

ملاحظة: كانت القراءة أكبر من الكتابة بنحو 460 مرة.

02 · مراجعة السيناريوهاتSCENAREV

486جولة

مدة التنفيذ
49 دقيقة
قراءة الذاكرة
110.2 مليون
كتابة الذاكرة
292 ألف
نسبة القراءة
99.73%

ملاحظة: أُعيد استخدام معظم رموز الإدخال.

03 · مراجعة ملخص طويلLONGSUM4

425جولة

مدة التنفيذ
48 دقيقة
قراءة الذاكرة
100.5 مليون
كتابة الذاكرة
264 ألف
نسبة القراءة
99.74%

ملاحظة: أظهرت المهام الطويلة نسبة إعادة استخدام مرتفعة أيضًا.

أهم ما توصلنا إليه

تشترك العمليات الثلاث في تنفيذ مهام ذات الهدف نفسه تباعًا خلال وقت قصير وفي جلسة واحدة.

تنبيه: هذا ارتباط قوي، لكنه لا يصنف مباشرة سبب كل عملية كتابة.
03

التطبيق / THE PLAYBOOK

جمّد البداية، وغيّر النهاية فقط.

يعتمد تحسين الذاكرة على كيفية بدء الجلسة ومواصلتها وتنظيمها.

BEFORE01

قبل البدء، حدد ما سيبقى ثابتًا.

  • نظّم القواعد الدائمة والمواد المرجعية
  • ثبّت إعدادات النموذج وMCP والأدوات
  • مهمة واحدة لكل سلسلة
DURING02

أثناء العمل، أضف التغييرات فقط.

  • ضع السؤال وأحدث نتيجة في النهاية
  • انقل الصور والسجلات إلى ملفات
  • نفّذ المهمة نفسها تباعًا
RESET03

عندما يثقل السياق، نظّمه.

  • اضغط سياق المهمة نفسها
  • ابدأ سلسلة جديدة عند تغير المهمة
  • راقب الإصابة والعدد المطلق للرموز

روبوت محادثة عام / PRESCRIPTION

سلسلة لكل موضوع؛ والمواد مرة واحدة

  1. 01

    رتّب الوصف والمواد مرة واحدة في البداية.

  2. 02

    واصل المهمة نفسها في السلسلة نفسها.

  3. 03

    اذكر فقط تغييرات المستندات الطويلة.

CACHE & CONTEXT HABITS

هذه العادات تضر بإعادة الاستخدام وكفاءة السياق.

  • ×وضع قيم ديناميكية في تعليمات النظام
  • ×تغيير قائمة الأدوات وترتيبها كثيرًا
  • ×تعديل المستند نفسه ثم إعادة لصقه
  • ×تكديس الصور والسجلات الخام
  • ×خلط مهام مختلفة في سلسلة واحدة

WHAT TO MEASURE

راقب النسب والقيم المطلقة معًا.

01قراءة / كتابة الذاكرة

هل تحدث الإصابة فعلًا؟

02إجمالي الإدخال لكل جولة

هل أصبحت الجلسة ثقيلة جدًا؟

03التكلفة لكل مهمة

كم تكلف كل نتيجة؟

04TTFT

هل يصل أول رمز أسرع؟

خط الأساس واتجاه حمل عملك أهم من معدل مثالي يفترض أنه يناسب الجميع.

04

رأي GPT / A MODEL'S TAKE

تحسين الذاكرة المخبأةليس حيلة في صياغة الموجّه،بل هو تصميم لبنية المعلومات.

معدل الإصابة مفيد، لكن 100% ليس الهدف. أعد استخدام الحقائق الثابتة واقرأ من جديد ما تحتاجه الآن فقط.

OPTIMIZE IN THIS ORDER
  1. 01إزالة السياق غير الضروري
  2. 02تثبيت المعلومات المستقرة
  3. 03فصل السلاسل حسب المهمة
  4. 04قياس معدل الإصابة

إذا تعارضت الذاكرة مع حداثة المعلومات أو دقتها، فامنح الدقة الأولوية.

05

فحص من 30 ثانية

YOUR NEXT SESSION

قبل البدء، تحقق من ست نقاط فقط.

0 / 6

كل بند مكتمل يجعل الجلسة أخف.

ONE LINE TO REMEMBER

الاستخدام الجيد للذاكرة =
استقرار البداية × إدارة حجم السياق × إيقاع العمل

كيف حُسبت الأرقام؟

نسبة التوفير = معدل الإصابة × (1 − تكلفة القراءة / تكلفة الإدخال العادي). عند 10% و80% إصابة، تنخفض تكلفة الإدخال نحو 72%.

هل تعمل الذاكرة بالطريقة نفسها في جميع أنظمة AI؟

لا. تختلف TTL والحدود الدنيا والخصومات وحقول usage بحسب المزوّد والنموذج.

هل تضمن المحادثة نفسها إصابة الذاكرة؟

لا. يعتمد الأمر على سياسات المزوّد وTTL وإدارة السياق الداخلية.

المصادر الأولية للتحقق

قارنّا الوثائق الرسمية والدراسة الأصلية كما في 13 أغسطس 2026، وأعدنا تجميع أرقام Orca من سجلات usage المحلية.