🔡 Contador de Caracteres Japoneses (文字数・バイト数)
Pega texto japonés para contar caracteres (con y sin espacios), bytes en UTF-8 y Shift-JIS, líneas, y caracteres de ancho completo vs medio ancho al instante.
¿Qué es esta herramienta?
Contar texto en japonés no es tan simple como parece. Un solo "carácter" puede ser una letra latina de medio ancho (1 byte en Shift-JIS), un kana o kanji de ancho completo (2 bytes en Shift-JIS), o una letra latina de ancho completo (también 2 bytes). Los formularios, bases de datos y sistemas japoneses heredados a menudo tienen límites expresados en recuentos de bytes en lugar de caracteres, así que una cadena que cabe en 30 caracteres puede desbordar un campo de 30 bytes. Conocer tanto el recuento de caracteres como el de bytes (en UTF-8 y Shift-JIS) es esencial para rellenar formularios web japoneses, diseñar columnas de bases de datos y escribir textos de longitud limitada.
Este contador de caracteres japoneses informa del recuento de caracteres con y sin espacios, el número de líneas, el recuento de bytes en UTF-8, el recuento de bytes en Shift-JIS y un desglose de caracteres de ancho completo vs medio ancho.
Cómo funciona
El contador recorre la entrada una vez y, para cada carácter, registra su longitud en bytes UTF-8 (1 para ASCII, 2 para el suplemento Latin-1 y el griego, 3 para kana, kanji y la mayoría de símbolos, 4 para emoji) y su longitud en bytes Shift-JIS (1 para ASCII y katakana de medio ancho, 2 para kana de ancho completo, kanji y latinos de ancho completo). También clasifica cada carácter como ancho completo o medio ancho comprobando su bloque Unicode, y cuenta espacios y saltos de línea por separado.
Cómo usar
- Pega tu texto japonés (o mixto) en el cuadro de entrada.
- Los contadores se actualizan al instante mientras escribes o pegas.
- Comprueba el recuento de caracteres con y sin espacios.
- Comprueba los recuentos de bytes UTF-8 y Shift-JIS para límites de formulario o base de datos.
- Usa el desglose de ancho completo vs medio ancho para planificar la normalización.
Preguntas Frecuentes
¿Por qué hay dos recuentos de bytes diferentes?
Los diferentes sistemas codifican el japonés de forma distinta. Las páginas web modernas usan UTF-8 (donde un kanji son 3 bytes), mientras que muchos sistemas gubernamentales y bancarios japoneses más antiguos usan Shift-JIS (donde un kanji son 2 bytes). La herramienta muestra ambos para que coincidas con el sistema que comprueba tu entrada.
Cuando un formulario dice que admite 30 bytes, ¿qué codificación significa?
Casi siempre significa bytes Shift-JIS, porque esa es la codificación heredada que los sistemas internos japoneses todavía usan. Planifica 2 bytes por carácter de ancho completo en ese caso.
¿Cómo se cuentan los emoji?
Los emoji suelen ocupar 4 bytes en UTF-8 y no son representables en Shift-JIS básico, así que a menudo hacen que los formularios heredados rechacen la entrada. El contador muestra su coste en bytes UTF-8 para que puedas detectarlos.
¿Cuenta palabras además de caracteres?
Se centra en caracteres y bytes porque el japonés no tiene espacios entre palabras, lo que hace que un recuento de palabras por división de espacios no sea fiable. El recuento de caracteres es la métrica de longitud estándar para texto japonés.
¿Cuál es la diferencia entre ancho completo y medio ancho?
Los caracteres de medio ancho (A, 1, ア) son estrechos y cuestan 1 byte Shift-JIS; los de ancho completo (A, 1, ア, 日) son anchos y cuestan 2. Los latinos y dígitos de ancho completo los producen los IME japoneses y a menudo se normalizan a medio ancho antes del envío.
¿Mi texto se envía a un servidor?
No. Todo el recuento ocurre en tu navegador con JavaScript. Nada se sube, almacena ni registra, así que es seguro pegar texto privado o en borrador.
Consejos
Cuando un formulario japonés dice que acepta "30 bytes", casi siempre significa bytes Shift-JIS, porque esa es la codificación heredada que la mayoría de los sistemas gubernamentales y bancarios todavía usan internamente: planifica 2 bytes por carácter de ancho completo. Los dígitos y letras latinas de ancho completo (0123, ABC) cuestan 2 bytes Shift-JIS cada uno, mientras que sus equivalentes de medio ancho cuestan 1, así que normalizar a medio ancho antes de enviar suele ahorrar espacio. Los emoji cuentan como 4 bytes UTF-8 y suelen ser rechazados por los formularios heredados. Para tweets y otros sistemas compatibles con Unicode, el recuento UTF-8 es lo que importa.
Herramientas Relacionadas
Conversor de Hiragana a Katakana
Convierte hiragana a katakana y katakana a hiragana al instante en tu navegador.
Conversor de Romaji
Convierte hiragana y katakana a romaji con Hepburn, Kunrei-shiki o Nihon-shiki.
Generador de Furigana
Añade lecturas furigana sobre los kanji en texto japonés. Generador de furigana
Asistente de Okurigana
Comprueba la ortografía correcta del okurigana para verbos y adjetivos japoneses
Buscador de Lecturas de Kanji
Busca las lecturas onyomi y kunyomi de cualquier kanji común. Buscador de lectur
Contador de Caracteres
Cuenta caracteres, letras, palabras y espacios de cualquier texto al instante. I
Contador de Palabras
Cuenta palabras, caracteres, frases y párrafos de cualquier texto al instante. I
Fuentes y Referencias
- Unicode Consortium. Codificación UTF-8.
- Wikipedia. Shift-JIS (codificación japonesa).
Limitaciones
- El recuento de bytes Shift-JIS es una aproximación; los emoji y algunos caracteres especiales pueden no ser representables.
- El contador no ofrece recuento de palabras porque el japonés no usa espacios.