es

Please fill in your name

Mobile phone format error

Ingrese el teléfono

Introduzca el nombre de su empresa

Introduzca el correo electrónico de su empresa.

Ingrese los datos requeridos

Successful submission! Thank you for your support.

Format error, Please fill in again

Confirm

El requisito de datos no puede ser inferior a 5 palabras y no pueden ser números puros.

Datasets de entrenamiento de alta calidad

Mejore el rendimiento de sus modelos de IA con nuestros Datasets de entrenamiento de alta calidad y listos para usar.

Idioma

Todo

Tipo de dato

Todo

262 Horas de Datos de Habla Infantil Japonesa

411 Hablantes – Aprox. 262 Horas de Conjunto de Datos de Habla Infantil Japonesa, que comprende 147.668 enunciados con guión. Los hablantes son niños japoneses de 6 a 13 años, categorizados en grados inferiores (6–9 años, 179 hablantes) y grados superiores (10–13 años, 232 hablantes) con distribución equilibrada por género. Las grabaciones se realizaron con teléfonos inteligentes en formato WAV mono 16kHz/16bit, acompañadas de transcripciones de enunciados y guiones de lectura. El conjunto de datos es aplicable a tareas como ASR infantil en japonés, TTS, reconocimiento de locutor y evaluación de pronunciación.
Japonés Niños Lectura en voz alta

68750 grupos de datos de edición de imágenes (edición basada en razonamiento)

68750 grupos en total, de los cuales 62500 corresponden a edición basada en conocimiento y 6250 a edición basada en reglas físicas. Las imágenes abarcan una amplia variedad de escenas y categorías. En la anotación, la imagen original se edita según las instrucciones del documento para generar una imagen de resultado; en la mayoría de las categorías, el proceso también incluye pasos de razonamiento. La precisión de coincidencia entre la imagen y el contenido textual es de al menos el 95 %. Los datos pueden utilizarse para tareas como generación de escenas virtuales, síntesis de imágenes y aumento de datos.
edición de imágenes edición basada en razonamiento edición basada en conocimiento edición basada en reglas físicas

12.500 conjuntos de datos de edición de imágenes (edición de escenas)

12.500 conjuntos de datos de edición de imágenes (edición de escenas), de los cuales 2.500 conjuntos son para ajuste de sombras, 2.500 para ajuste de iluminación, 2.500 para añadir/eliminar objetos reflectantes, 2.500 para corrección de exposición y 2.500 para filtros de efectos. Las imágenes abarcan diversas escenas, categorías, condiciones climáticas y franjas horarias. La precisión de correspondencia entre la imagen y el contenido textual no es inferior al 95%. Los datos pueden utilizarse para tareas como síntesis de imágenes y generación de escenas virtuales.
Edición de imágenes edición de escenas filtros de efectos corrección de exposición añadir/eliminar efectos de reflexión ajuste de iluminación

Datos de imágenes de alta calidad_T

3 millones de datos de imágenes de alta calidad. Esta base de datos está compuesta por obras de imagen originales y con licencia publicadas por el autor, la mayoría en resolución 4K o superior, y abarca diversas categorías como retratos, gastronomía, paisajes, arquitectura y más.
Imágenes alta resolución

Conjunto de datos para competición de voz de diálogo multilingüe Interspeech2025-MLC-SLM

El contexto del conjunto de datos para la competición de voz de diálogo multilingüe Interspeech2025-MLC-SLM es que Datatang organizó la competición de voz de diálogo multilingüe MLC-SLM en 2025, el conjunto de datos proviene de quince conjuntos de datos de voz de diálogo propios de Datatang. Los datos tienen alta precisión y fuerte facilidad de uso, están diseñados específicamente para superar los cuellos de botella tecnológicos del reconocimiento de voz multilingüe y la comprensión de contexto largo, capturan de manera realista escenarios de interacción complejos como la superposición de hablantes e interrupciones improvisadas, proporcionando recursos ricos para investigación y aplicaciones relacionadas con el reconocimiento de voz, y ayuda a que los modelos se desempeñen mejor frente a la diversidad del mundo real. Seguimos estrictamente las regulaciones de protección de datos y privacidad, garantizando la protección de la privacidad y los derechos legítimos de los usuarios durante la recolección, almacenamiento y uso de datos, y todos los datos cumplen con GDPR, CCPA y PIPL.
Conjunto de datos de audio de taller conjunto de datos MLC-SLM datos de reconocimiento de voz ASR

111 horas de datos de voz de lectura en griego recogidos por móvil

Datos de voz en griego de lectura (móvil), basados en guiones dados para lectura y grabación simulada, con un total de 95 grabadores, los grabadores son de Grecia, el entorno de grabación es silencioso y sin eco. El contenido de la grabación es extenso, aproximadamente 1000 oraciones por persona. El texto ha sido corregido manualmente, con alta precisión, proporcionando recursos ricos para investigación y aplicaciones relacionadas con el reconocimiento de voz, y ha sido verificado por múltiples empresas de IA: ayuda a que los modelos se desempeñen mejor frente a la diversidad del mundo real. Seguimos estrictamente las regulaciones de protección de datos y privacidad, garantizando la protección de la privacidad y los derechos legítimos de los usuarios durante la recolección, almacenamiento y uso de datos, y todos los datos cumplen con GDPR, CCPA y PIPL.
Conjunto de datos de monólogo guionizado en griego conjunto de datos de voz en griego conjunto de datos de audio en griego datos de voz en griego datos de síntesis de voz en griego

280 horas de datos de voz de lectura en noruego recogidos por móvil

Datos de voz en noruego de lectura (móvil), basados en guiones dados para lectura y grabación simulada, con un total de 157 grabadores, los grabadores son de Noruega, el entorno de grabación es silencioso y sin eco. El contenido de la grabación es extenso, aproximadamente 1000 oraciones por persona. El texto ha sido corregido manualmente, con alta precisión, proporcionando recursos ricos para investigación y aplicaciones relacionadas con el reconocimiento de voz, y ha sido verificado por múltiples empresas de IA: ayuda a que los modelos se desempeñen mejor frente a la diversidad del mundo real. Seguimos estrictamente las regulaciones de protección de datos y privacidad, garantizando la protección de la privacidad y los derechos legítimos de los usuarios durante la recolección, almacenamiento y uso de datos, y todos los datos cumplen con GDPR, CCPA y PIPL.
Conjunto de datos de monólogo guionizado en noruego conjunto de datos de voz en noruego datos de síntesis de voz en noruego corpus NLP para noruego datos de voz en noruego conjunto de datos de audio en noruego

500.000 imágenes de datos de anotación OCR de escenas naturales, escenas de fotos de documentos y escenas electrónicas de 21 países

500.000 imágenes de datos de anotación OCR de escenas naturales, escenas de fotos de documentos y escenas electrónicas de 21 países. Los datos incluyen 21 idiomas, con una distribución de 20,000 a 25,000 imágenes por idioma. Los tipos de datos incluyen escenas naturales, escenas de fotos de documentos y escenas electrónicas. La diversidad de datos incluye múltiples tipos de datos, múltiples ángulos de captura y múltiples idiomas. En cuanto a la anotación, se utiliza anotación a nivel de fila (columna) con cuadriláteros o polígonos y transcripción de contenido a nivel de fila (columna). Los datos pueden utilizarse para tareas de reconocimiento OCR multilingüe.
Conjunto de datos OCR multilingüe datos de reconocimiento de texto en escenas conjunto de datos OCR de documentos datos OCR de pantallas electrónicas conjunto de datos OCR 21 idiomas datos de entrenamiento OCR para IA conjunto de datos de reconocimiento de texto

200.000 conjuntos de datos de imagen y texto de edificios emblemáticos de múltiples países

200.000 conjuntos de datos de imagen y texto de edificios emblemáticos de múltiples países. Cada conjunto de datos contiene una imagen + un documento de descripción en chino e inglés. Los hitos nacionales incluyen 80.000 conjuntos, y los hitos de otros países 120.000 conjuntos. La distribución de países incluye no menos de 20 países, incluyendo Estados Unidos, Reino Unido, Francia, Rusia, Alemania, etc. El número de imágenes correspondientes a cada hito se distribuye entre 1 y 10 imágenes, incluyendo información del hito desde diferentes ángulos, distancias y períodos de tiempo. Los tipos de hitos incluyen varios tipos de edificios emblemáticos, como rascacielos comerciales, edificios antiguos, monumentos, bibliotecas, atracciones turísticas, etc. En cuanto al contenido de la anotación, se anota el país del hito, la ciudad del hito, la ubicación específica del hito, la clasificación del hito y la descripción del hito. Los datos pueden utilizarse para el reconocimiento y análisis de edificios emblemáticos.
Conjunto de datos de imágenes de hitos conjunto de datos de reconocimiento de edificios conjunto de datos de descripción de imágenes de hitos globales datos de descripción de imágenes bilingües conjunto de datos de descripción chino-inglés conjunto de datos de clasificación de hitos conjunto de datos de imagen y texto conjunto de datos de hitos turísticos conjunto de datos de imágenes de patrimonio cultural descripción de imágenes para entrenamiento de IA

581 horas de datos de voz coloquial en griego

Datos de voz coloquial en griego, transmisiones en vivo, etc., reflejando situaciones de interacción del mundo real. Este conjunto de datos anota múltiples atributos como el contenido de texto, identidad y género del hablante, etc., grabados por múltiples rumanos de diferentes regiones y antecedentes culturales, con alta precisión y facilidad de uso, proporcionando recursos ricos para investigación y aplicaciones relacionadas con el reconocimiento de voz, y ayuda a que los modelos se desempeñen mejor frente a la diversidad del mundo real. Seguimos estrictamente las regulaciones de protección de datos y privacidad, garantizando la protección de la privacidad y los derechos legítimos de los usuarios durante la recolección, almacenamiento y uso de datos, y todos los datos cumplen con GDPR, CCPA y PIPL.
Conjunto de datos de voz en griego datos de entrenamiento ASR para griego corpus de conversación en griego voz monólogo en griego conjunto de datos de reconocimiento de voz en griego datos de voz a texto en griego conjunto de datos de voz en griego conjunto de datos de transcripción en griego

600 horas de datos de voz coloquial en noruego

Datos de voz coloquial en noruego, con contenido que cubre áreas generales como medios sociales, diálogos, transmisiones en vivo, etc., reflejando situaciones de interacción del mundo real. Este conjunto de datos anota múltiples atributos como el contenido de texto, identidad y género del hablante, etc., grabados por múltiples rumanos de diferentes regiones y antecedentes culturales, con alta precisión y facilidad de uso, proporcionando recursos ricos para investigación y aplicaciones relacionadas con el reconocimiento de voz, y ayuda a que los modelos se desempeñen mejor frente a la diversidad del mundo real. Seguimos estrictamente las regulaciones de protección de datos y privacidad, garantizando la protección de la privacidad y los derechos legítimos de los usuarios durante la recolección, almacenamiento y uso de datos, y todos los datos cumplen con GDPR, CCPA y PIPL.
conjunto de datos de voz en noruego datos de entrenamiento ASR para noruego corpus de conversación en noruego voz monólogo en noruego conjunto de datos de reconocimiento de voz en noruego datos de voz a texto en noruego conjunto de datos de voz en noruego datos de voz multilingües conjunto de datos de transcripción en noruego

Datos textuales de la plataforma de preguntas-respuestas japonesa OKWAVE

Datos de texto de la plataforma de preguntas y respuestas OKWAVE de Japón, que contienen múltiples campos como pregunta, respuesta, categoría, fecha de publicación, autor de la publicación; los datos se actualizan continuamente. Hasta finales de abril de 2025: 8,4 millones de preguntas, 2,3 mil millones de caracteres; 27 millones de respuestas, 7,6 mil millones de caracteres; 15,5 millones de agradecimientos (agradecimientos expresados por el que pregunta al que responde), 1,7 mil millones de caracteres; 2,1 millones de explicaciones complementarias, 360 millones de caracteres; estos datos pueden usarse para el entrenamiento de modelos grandes generales.
Pregunta-respuesta Texto Japonés
. . .
loading

loading

c06672e0-45b8-41fd-b384-1adfa37295ef