Inworld TTS

الوصف
🖼️ اسم الأداة:
Inworld Realtime TTS
🔖 التصنيفات:
صوت وكلام وموسيقى
تكاملات وواجهات API
نص الى صوت / صوت الى نص
استنساخ الأصوات
✏️ ما الذي تقدّمه هذه الأداة؟
Inworld Realtime TTS هي تقنية لتحويل النص إلى كلام في الوقت الفعلي من Inworld، وتوفر نماذج صوتية موجهة للتطبيقات التي تحتاج إلى توليد كلام سريع وواقعي وقابل للتفاعل. تشمل المنصة Realtime TTS-2، وهو النموذج الرئيسي الحالي، وRealtime TTS-2 Flash المخصص للتطبيقات التي تتطلب زمن استجابة منخفضًا وتكلفة أقل، إضافة إلى نماذج Realtime TTS السابقة مثل Realtime TTS 1 وRealtime TTS 1-Max. يوفر Realtime TTS-2 تعبيرًا صوتيًا متقدمًا وإمكانية التحكم في طريقة الإلقاء باستخدام تعليمات باللغة الطبيعية، كما يدعم الإشارات غير اللفظية مثل الضحك والتنهد والتنفس والسعال والتثاؤب وتنظيف الحلق، ويمكن استخدام صوت واحد عبر لغات متعددة. وتوفر المنصة استنساخًا فوريًا للصوت باستخدام عينة صوتية قصيرة، إضافة إلى Voice Design لإنشاء أصوات مخصصة، كما تدعم التحكم في سرعة الكلام ودرجة الحرارة والنطق المخصص والطوابع الزمنية وبيانات المحاذاة. ويتيح Realtime TTS-2 زمن وصول أقل من 100ms بحسب قياس TTFB على الخادم، بينما يصل Realtime TTS-2 Flash إلى 25ms وفق الموقع الرسمي. كما تدعم النماذج الحالية أكثر من 200 لغة مع إمكانات متعددة اللغات والانتقال بين اللغات باستخدام رموز BCP-47.
يمكن استخدام Realtime TTS من خلال API وRealtime API، كما يمكن تجربة الأصوات والميزات مباشرة عبر TTS Playground. وتوفر Inworld واجهات تكامل للتطبيقات الصوتية في الوقت الفعلي، بما في ذلك WebSocket، مع دعم WebRTC وSIP في الوصول المبكر وفق الموقع الرسمي. ويمكن استخدام التقنية في تطبيقات تشمل الوكلاء الصوتيين والتطبيقات الاستهلاكية والتطبيقات التعليمية والألعاب والمرافقين الافتراضيين وغيرها من التطبيقات التي تحتاج إلى صوت تفاعلي في الوقت الفعلي.
كان Realtime TTS 1، الذي أعلنت عنه Inworld في عام 2025، يوفر توليدًا واقعيًا ومدركًا للسياق واستنساخًا للصوت من عينات قصيرة دون تدريب مسبق، وكان متاحًا عبر API وTTS Playground، بينما كان Realtime TTS 1-Max متاحًا بصورة تجريبية. أما حاليًا، فتقدم Inworld Realtime TTS-2 بوصفه النموذج الرئيسي، مع Realtime TTS-2 Flash كخيار أسرع وأكثر تركيزًا على تقليل زمن الاستجابة والتكلفة.
وتوفر Inworld أيضًا أدوات للمطورين تشمل API Reference وDocumentation وTTS Playground، كما توفر إطار تدريب مفتوح المصدر مرتبطًا بأبحاث Realtime TTS، بما يسمح بإعادة بناء نماذج TTS وفق المنهجية التي نشرتها الشركة. وتوفر المنصة كذلك إمكانات الدمج مع أنظمة التطبيقات الصوتية، ويمكن استخدام نماذجها من خلال واجهات برمجة التطبيقات مباشرة.
⭐ ما الذي تقدّمه فعليًا بناءً على تجربة المستخدمين؟
• توفر توليدًا صوتيًا سريعًا ومناسبًا للتطبيقات التي تحتاج إلى استجابة فورية، مع TTFB أقل من 100ms في Realtime TTS-2 و25ms في Realtime TTS-2 Flash وفق القياسات المنشورة من Inworld.
• توفر Realtime TTS-2 تعبيرًا صوتيًا متقدمًا مع إمكانية توجيه النبرة والمشاعر باستخدام تعليمات باللغة الطبيعية مباشرة داخل النص.
• تتيح إضافة إشارات غير لفظية مثل الضحك والتنهد والتنفس والسعال والتثاؤب وتنظيف الحلق إلى الكلام الناتج.
• تتيح استنساخ الصوت فورياً باستخدام عينة صوتية قصيرة، وتذكر Inworld أن استنساخ الصوت يمكن أن يتم باستخدام عينة نظيفة لمتحدث واحد مدتها من 5 إلى 15 ثانية.
• توفر Voice Design لإنشاء صوت مخصص من وصف مكتوب، دون الحاجة إلى عينة صوتية مرجعية.
• تدعم الاستخدام متعدد اللغات، ويذكر الموقع الحالي دعم أكثر من 200 لغة، مع إمكانية استخدام صوت واحد عبر لغات متعددة.
• وفق Inworld، يتم تقييم جودة Realtime TTS من خلال اختبارات استماع عمياء يشارك فيها آلاف المستخدمين، كما تذكر الشركة أن Realtime TTS-2 تم ضبطه لتحقيق تعبيرية أعلى مع تقليل مشكلات مثل الهلوسة وانقطاع الكلمات وتحسين طبيعية المحادثة. هذه نتائج وتوصيفات منشورة من Inworld وليست تقييمًا مستقلًا مني.
• تتيح المنصة تجربة الأصوات مباشرة من خلال TTS Playground قبل دمجها في التطبيقات، ثم الانتقال إلى API عند البدء في التطوير.
🤖 هل تتضمّن الأتمتة؟
لا تذكر المعلومات الرسمية المتاحة وجود نظام أتمتة مستقل داخل Realtime TTS بالمعنى التقليدي لأدوات أتمتة المهام. لكن الأداة توفر API وRealtime API، ما يسمح للمطورين بدمج توليد الكلام في تطبيقاتهم وسير العمل البرمجي بصورة آلية. كما يتيح Realtime API تشغيل طبقات الكلام وتحويل النص إلى كلام وغيرها ضمن جلسة واحدة، مع إمكانية استخدام WebSocket، بينما تتوفر WebRTC وSIP في الوصول المبكر.
💰 نموذج التسعير:
Freemium / مدفوع / اشتراك / تسعير حسب الاستخدام. توفر Inworld خطة On-Demand يمكن البدء بها مجانًا، وخطط اشتراك شهرية تشمل Creator وBuilder وDeveloper وGrowth، إضافة إلى خطة Enterprise بتسعير مخصص. كما تنخفض تكلفة الحرف الواحد في المستويات الأعلى، وتوفر الشركة خيار الدفع السنوي مع شهرين مجانًا. وتُحتسب استخدامات TTS حسب عدد الأحرف، بينما تُحتسب STT حسب الساعة، وتُحتسب نماذج LLM وفق تكلفة المزود.
🆓 تفاصيل الخطة المجانية:
| العنصر | التفاصيل |
|---|---|
| الخطة | On-Demand |
| السعر | Start free |
| TTS-2 | $25 لكل 1 مليون حرف |
| TTS-2 Flash | $15 لكل 1 مليون حرف |
| STT 1 | $0.15 لكل ساعة |
| LLMs | At cost |
| TTS المتضمن | حتى 70 دقيقة |
| الأصوات المخصصة | 100 |
| استنساخ الصوت وتصميم الصوت | متاح |
| Realtime API | متاح |
| نماذج LLM عبر Router | أكثر من 220 نموذجًا |
| الترخيص التجاري | متاح |
| الدعم | Community support |
| الوصول | يمكن اختيار On-Demand من صفحة الفوترة |
وتذكر صفحة التسعير أن On-Demand مناسبة للتقييم وإنشاء النماذج الأولية، وأنها توفر حتى 70 دقيقة من TTS مجانًا. كما يوضح حاسبة التكلفة الرسمية أن الخطة الموصى بها عند اختيار Text-to-Speech مع 0 دقيقة استخدام هي On-Demand، وتكون تكلفة الخطة الإجمالية Free.
💳 تفاصيل الخطط المدفوعة:
| الخطة | السعر الشهري | Realtime TTS-2 | Realtime TTS-2 Flash | الرصيد الشهري | أبرز المزايا |
|---|---|---|---|---|---|
| Creator | $25/mo | $20 لكل 1M حرف | $10 لكل 1M حرف | $25 | خصم يصل إلى 33%، و500 صوت مخصص، و40K حرف لكل طلب في TTS Playground، وإنشاء ومشاركة Workspace وإدارة الفريق |
| Builder | $100/mo | $17.50 لكل 1M حرف | $9 لكل 1M حرف | $100 | خصم يصل إلى 40%، و3,000 صوت مخصص، وحدود تزامن أعلى، وإنشاء ومشاركة Workspace وإدارة الفريق |
| Developer | $300/mo | $15 لكل 1M حرف | $8 لكل 1M حرف | $300 | خصم يصل إلى 47%، و10,000 صوت مخصص، وحدود تزامن أعلى، واستنساخ صوت احترافي كإضافة، ودعم أولوية عبر البريد |
| Growth | $1,500/mo | $12.50 لكل 1M حرف | $7 لكل 1M حرف | $1,500 | خصم يصل إلى 53%، و30,000 صوت مخصص، وحدود API أعلى، واستنساخ صوت احترافي واحد، وإضافات ZDR وHIPAA وBAA |
| Enterprise | Custom | يبدأ من $5 لكل 1M حرف | أقل من $5 لكل 1M حرف | Custom | تسعير وحدود مخصصة، Price match، SLA وDPA، إقامة بيانات في EU وIndia، ومدير حساب مخصص وقناة Slack |
تُظهر صفحة التسعير الرسمية أن أسعار TTS-2 تنخفض من $25 لكل مليون حرف في On-Demand إلى $20 في Creator، و$17.50 في Builder، و$15 في Developer، و$12.50 في Growth، وتصل إلى ما لا يقل عن $5 في Enterprise. أما TTS-2 Flash فتبدأ من $15 وتصل إلى $10 و$9 و$8 و$7 على التوالي، ثم إلى أقل من $5 في Enterprise. ويتم احتساب الاستخدام الإضافي بالسعر نفسه الخاص بالخطة.
| الميزة | On-Demand | Creator | Builder | Developer | Growth | Enterprise |
|---|---|---|---|---|---|---|
| API access | متاح | متاح | متاح | متاح | متاح | متاح |
| Audio downloads | متاح | متاح | متاح | متاح | متاح | متاح |
| حد الأحرف في TTS Playground | 2,000 | 40,000 | 40,000 | 40,000 | 40,000 | Custom |
| Custom voices | 100 | 500 | 3,000 | 10,000 | 30,000 | Custom |
| Instant voice cloning | متاح | متاح | متاح | متاح | متاح | متاح |
| Professional voice cloning | — | — | — | Add-on | 1 | Custom |
| Voice design | متاح | متاح | متاح | متاح | متاح | متاح |
| Steering | متاح | متاح | متاح | متاح | متاح | متاح |
| Speaking rate control | متاح | متاح | متاح | متاح | متاح | متاح |
| Temperature control | متاح | متاح | متاح | متاح | متاح | متاح |
| 200+ languages | متاح | متاح | متاح | متاح | متاح | متاح |
| Custom pronunciation | متاح | متاح | متاح | متاح | متاح | متاح |
| Timestamps | متاح | متاح | متاح | متاح | متاح | متاح |
| Concurrent requests | 5 | 10 | 50 | 150 | 500 | Custom |
| Est. concurrent user sessions | 20 | 40 | 200 | 600 | 2,000 | Custom |
| GDPR & SOC 2 Type II | متاح | متاح | متاح | متاح | متاح | متاح |
| Commercial license | متاح | متاح | متاح | متاح | متاح | متاح |
| Credit rollover | متاح | متاح | متاح | متاح | متاح | متاح |
| HIPAA & BAA | — | — | — | — | Add-on | متاح |
| Zero data retention | — | — | — | — | Add-on | متاح |
| SLA & DPA | — | — | — | — | — | متاح |
| Data residency | — | — | — | — | — | EU, India |
| Payment | — | Credit card | Credit card | Credit card | Credit card | Invoicing / PO |
| Support | Community | Community | Community | Priority email | Priority email | AM + Slack |
توضح صفحة التسعير الرسمية أن عدد جلسات المستخدمين المتزامنة المقدّر يختلف حسب حالة الاستخدام، لكنه يكون عادةً على الأقل أربعة أضعاف حد الطلبات المتزامنة. كما توضح أن الاعتمادات المدفوعة تخضع لشروط انتهاء محددة، وأن تفاصيل الترحيل أو الإلغاء تعتمد على حالة الاشتراك ودورة الفوترة.
🧭 طريقة الوصول إلى الأداة:
| طريقة الوصول | التفاصيل |
|---|---|
| الويب | يمكن استخدام الموقع الرسمي لـInworld وتجربة الخدمة عبر TTS Playground |
| TTS Playground | تجربة الأصوات، الإعدادات، واستنساخ الصوت مباشرة |
| API | دمج Realtime TTS في التطبيقات من خلال API |
| Realtime API | بناء تطبيقات صوتية في الوقت الفعلي وتشغيل طبقات الصوت والنماذج ضمن جلسة واحدة |
| WebSocket | متاح في Realtime API |
| WebRTC | متاح في الوصول المبكر |
| SIP | متاح في الوصول المبكر |
| التوثيق | Documentation وAPI Reference متاحان للمطورين |
| خطط المؤسسات | التواصل مع فريق المبيعات للحصول على التسعير والحدود المخصصة |
وتوفر Inworld إمكانية تجربة Realtime TTS من خلال TTS Playground، كما يمكن إنشاء API Key والبدء بطلبات API، وتدعم الخدمة حاليًا مخرجات صوتية تشمل MP3 وLinear PCM/WAV وOpus وفق الموقع الرسمي.
🔗 رابط التجربة أو الموقع الرسمي:
Inworld Realtime TTS – الموقع الرسمي