الانتقال إلى المحتوى الرئيسي
كل المشاريع
AI Agent

Corpusforge

استوديو يعمل محليًا يخطط فيه وكيل ذكاء اصطناعي لبيانات تدريب حوارية ويكتبها ويتحقق منها بالاستناد إلى مصادر حقيقية، ثم يسلّمك مجموعة بيانات نظيفة بالصيغة التي يقرؤها نظام التدريب لديك.

جرّبه مباشرةكود خاصشاهد التشغيل
Corpusforge
  • 8/8

    محادثات مقبولة في التشغيل المسجل

  • 84.7

    متوسط درجة الجودة من 100

  • 3:11

    دقائق للمهمة كاملة على حصة مجانية

  • $0.02

    التكلفة الكاملة لـ70 دورًا موثقًا

من داخل المنتج

شاهده وهو يعمل

شاشات حقيقية وتسجيل لتشغيل فعلي، مأخوذة من المنتج نفسه.

Corpusforge
تشغيل حقيقي: إضافة مصدرين (ملف واستيراد رابط)، كتابة الطلب للوكيل وخطته، الإطلاق، المهمة مباشرة من 0% إلى 100% (مسرّعة 14 مرة، والتشغيل الحقيقي استغرق 3 دقائق و11 ثانية)، ثم مجموعة البيانات النهائية من المحادثات المقبولة.
Corpusforge
عرض بالحجم الكامل

الصفحة الرئيسية للاستوديو: «حوّل أي مصدر إلى بيانات تدريب تثق بها» مع مشهد المصادر ثم الصهر ثم التحقق المتحرك.

01 / 16

دوري

المهندس الوحيد على المشروع: وكيل التخطيط، مسار التوليد والتحقق، منظّم معدل الطلبات، شاشة المتابعة المباشرة، والواجهة ثنائية اللغة.

المشكلة

النموذج المدرّب لا يتجاوز جودة أسوأ محادثة في بيانات تدريبه، ومخرجات النماذج الخام تنحرف: تختلق حقائق، وتسرّب عبارات مثل «حسب النص»، وتكرر نفسها. كتابة المحادثات يدويًا لا تتوسع، والبرومبت الواحد لا يعطي طريقة لفحص الناتج أو إصلاحه.

ما الذي بنيته

يتعامل Corpusforge مع التوليد كمسار ببوابة جودة. وكيل يعتمد على الأدوات يحوّل هدفًا مكتوبًا بلغة عادية إلى مهمة محددة (المواضيع، عدد المحادثات، عدد الأدوار، طول الإجابة، الشخصيات، الأساليب، وتقدير التكلفة والوقت)، ولا يعمل شيء حتى تضغط «إطلاق».

تُكتب المحادثات من مادة حقيقية لا من الذاكرة: ملفاتك، أو صفحات ويب مستوردة برابط بعد تنظيفها من القوائم والإعلانات والتذييل، أو صفحات بحث عنها الوكيل، أو معرفة النموذج للمواضيع منخفضة المخاطر. كل دور يمر بفحوص حتمية (البنية، خصوصية المصدر، اللغة والكتابة، التنوع، طول الإجابة، الأسلوب، والاستناد للمصادر)، وما يفشل يعود للنموذج كملاحظات إصلاح، ثم تُقيّم كل محادثة من 0 إلى 100 وتُصنف كمقبولة أو معلّمة أو مرفوضة حسب عتبات تحددها أنت. تراجع الأدلة بضغطة زر للقبول أو التعليم أو الرفض، وتصدّر إلى OpenAI JSONL وShareGPT وAlpaca وCSV وExcel وParquet.

المعمارية

واجهة خلفية Python وFastAPI مع SQLAlchemy 2 غير المتزامن على SQLite (WAL)، وServer-Sent Events لشاشة المتابعة المباشرة، وtrafilatura لاستخراج نظيف من الويب، وPyMuPDF وpython-docx للملفات، وPyArrow لصيغة Parquet، وبحث دلالي في المصادر عبر gemini-embedding-2. واجهة Next.js 16 مصدّرة كملفات ثابتة مع React 19 وTailwind CSS وMotion يخدمها الـAPI نفسه. يعمل مع Gemini مباشرة أو مع أي نقطة متوافقة مع OpenAI (OpenAI وOllama وLM Studio وvLLM وllama.cpp). وسكربت واحد متعدد الأنظمة للتنصيب والتشغيل والفحص واختبار التشغيل السريع.

التحديات

تشغيل مهام طويلة على حدود مجانية صارمة دون عواصف إعادة المحاولة. منظّم معدل تكيفي يجمع نافذة منزلقة للطلبات والتوكنات، وبوابة تزامن AIMD، وتهدئة شاملة عند تلميحات 429، فتتحول دفعة استهلاك الحصة إلى توقف قصير. المهام تتوقف وتُستأنف وتنجو من إعادة التشغيل. وكان على التوليد وفحوص الجودة أن تتعامل مع العربية بشكل صحيح (التوحيد والكتابة والتشكيل)، مع إمكانية كتابة المحادثات بلهجات مثل اللهجة الأردنية.

القرارات الهندسية

فحوص حتمية افتراضيًا بدل نموذج يحكم على نموذج، فتكون الجودة رخيصة وقابلة للشرح والتكرار. الوكيل يقترح ولا يطلق شيئًا من تلقاء نفسه. وكل إجابة مقبولة تحتفظ بمقاطع المصادر التي تستند إليها، فيمكن تتبع أي رقم في مجموعة البيانات.

النتائج والأثر

في التشغيل المسجل قرأ الوكيل مصدرين (دليل إنجليزي للطاقة الشمسية وصفحة عربية مستوردة برابط بعد تنظيفها من شريط الكوكيز والقائمة والإعلان والتذييل) وخطط لـ8 محادثات دعم عملاء بالإنجليزية واللهجة الأردنية بتكلفة 0.0005 دولار. انتهت المهمة خلال 3 دقائق و11 ثانية بمعدل 15 طلبًا في الدقيقة: 8 من 8 مقبولة، 70 دورًا، متوسط جودة 84.7 (من 78.6 إلى 88.7)، 53 طلبًا، 114.9 ألف توكن، و0.02 دولار. حلقة الإصلاح أعادت كتابة أدوار وجدها فحص الاستناد غير مدعومة قبل قبولها. ومهمة ثانية أوقفت 4 محادثات أضعف للمراجعة (درجات 64 إلى 66) بدل تمريرها، وتوقفت 42 ثانية عندما طلب المزود ذلك بدل أن تفشل.

أبرز النقاط

  • وكيل تخطيط بالأدوات: اقتراح مواضيع، البحث في الويب، قراءة المصادر والبحث فيها، مراجعة مجموعة البيانات، واقتراح مهمة
  • ثلاثة أوضاع للاستناد: البحث، ملفاتك وروابطك، أو المواضيع فقط
  • استيراد نظيف يزيل القوائم والإعلانات وأشرطة الكوكيز والتذييل
  • بوابة جودة مع حلقة إصلاح وتقييم من 0 إلى 100 وعتبات وإزالة التكرار
  • شاشة متابعة مباشرة عبر Server-Sent Events مع مشهد متحرك من المصادر إلى الصهر إلى التحقق
  • لوحة مراجعة بجودة كل بُعد ومقاطع الأدلة ومراجعة بلوحة المفاتيح
  • تصدير إلى OpenAI chat JSONL وShareGPT وAlpaca وCSV وExcel وParquet
  • واجهة عربية وإنجليزية مع دعم كامل للاتجاه من اليمين لليسار، وضع داكن وفاتح، لوحة أوامر، وتصميم للجوال