← Início

🔡 Contador de Caracteres Japoneses (文字数・バイト数)

Cole texto japonês para contar caracteres (com e sem espaços), bytes em UTF-8 e Shift-JIS, linhas e caracteres de largura total vs meia largura instantaneamente.

O que é esta ferramenta?

Contar texto em japonês não é tão simples quanto parece. Um único "caractere" pode ser uma letra latina de meia largura (1 byte em Shift-JIS), um kana ou kanji de largura total (2 bytes em Shift-JIS) ou uma letra latina de largura total (também 2 bytes). Formulários, bancos de dados e sistemas japoneses antigos costumam ter limites expressos em contagens de bytes em vez de contagens de caracteres, então uma string que cabe em 30 caracteres pode estourar um campo de 30 bytes. Conhecer tanto a contagem de caracteres quanto a de bytes — em UTF-8 e Shift-JIS — é essencial para preencher formulários web japoneses, projetar colunas de banco de dados e escrever textos para SMS ou tweets.

Este contador de caracteres japoneses relata a contagem de caracteres com e sem espaços, a contagem de linhas, a contagem de bytes em UTF-8, a contagem de bytes em Shift-JIS e uma análise de caracteres de largura total vs meia largura. É feito para escritores localizando textos para japonês, desenvolvedores dimensionando campos de banco de dados e qualquer pessoa preenchendo um formulário governamental ou bancário japonês com limite de bytes. Para as tarefas relacionadas de converter kana ou romanizar texto, use o conversor de kana e o conversor de romaji.

Consulte a tabela abaixo para como diferentes tipos de caractere contribuem para as contagens:

Tipo de caractereExemploBytes UTF-8Bytes Shift-JIS
ASCII (latim meia largura)A, 1, !11
Kanaあ, ア32
Kanji日, 本32
Latim de largura totalA, 132
Emoji😊4n/a

Como funciona

O contador percorre a entrada uma vez e, para cada caractere, registra seu comprimento em bytes UTF-8 (1 para ASCII, 2 para suplemento Latin-1 e grego, 3 para kana, kanji e a maioria dos símbolos, 4 para emoji e caracteres do plano astral) e seu comprimento em bytes Shift-JIS (1 para ASCII e katakana de meia largura, 2 para kana de largura total, kanji e latim de largura total). Ele também classifica cada caractere como largura total ou meia largura verificando seu bloco Unicode e conta espaços e quebras de linha separadamente para que você possa obter um total "sem espaços".

A tabela abaixo lista as faixas Unicode usadas para classificar a largura:

LarguraBlocos UnicodeConteúdo típico
Meia larguraU+0000–U+007F, U+FF61–U+FFDCASCII, katakana de meia largura
Largura totalU+3040–U+30FF, U+4E00–U+9FFF, U+FF00–U+FF60kana, kanji, latim de largura total
Outrosemoji, marcas de combinaçãocontado por comprimento de byte UTF-8

Toda a contagem roda localmente no seu navegador, então até texto sensível nunca sai do seu dispositivo. Para preparar o texto primeiro — normalizando largura, convertendo kana ou romanizando...

Ad

Como usar

  1. Cole seu texto japonês (ou misto) na caixa de entrada.
  2. Os contadores se atualizam instantaneamente enquanto você digita ou cola.
  3. Verifique a contagem de caracteres com e sem espaços.
  4. Verifique as contagens de bytes UTF-8 e Shift-JIS para limites de formulário ou banco de dados.
  5. Use a análise de largura total vs meia largura para planejar a normalização.

Perguntas Frequentes

Por que há duas contagens de bytes diferentes?

Sistemas diferentes codificam o japonês de forma diferente. Páginas web modernas usam UTF-8 (onde um kanji tem 3 bytes), enquanto muitos sistemas governamentais e bancários japoneses antigos usam Shift-JIS (onde um kanji tem 2 bytes). A ferramenta relata ambos para que você possa corresponder ao sistema que está verificando sua entrada.

Quando um formulário diz que aceita 30 bytes, qual codificação significa?

Quase sempre significa bytes Shift-JIS, porque essa é a codificação antiga que os sistemas de back-end japoneses ainda usam. Planeje 2 bytes por caractere de largura total nesse caso.

Como os emoji são contados?

Emoji costumam ter 4 bytes em UTF-8 e não são representáveis em Shift-JIS básico, então costumam fazer formulários antigos rejeitarem a entrada. O contador mostra o custo em bytes UTF-8 deles para que você possa identificá-los.

Conta palavras além de caracteres?

Foca em caracteres e bytes porque o japonês não tem espaços entre palavras, tornando a contagem de palavras dividida por espaços não confiável. A contagem de caracteres é a métrica padrão de comprimento para texto japonês.

Qual a diferença entre largura total e meia largura?

Caracteres de meia largura (A, 1, ア) são estreitos e custam 1 byte Shift-JIS; caracteres de largura total (A, 1, ア, 日) são largos e custam 2. Latim e dígitos de largura total são produzidos por IMEs japoneses e costumam ser normalizados para meia largura antes do envio.

Meu texto é enviado a um servidor?

Não. Toda a contagem acontece no seu navegador com JavaScript. Nada é carregado, armazenado ou registrado, então é seguro colar textos privados ou rascunhos.

Dicas

Quando um formulário japonês diz que aceita "30 bytes", quase sempre significa bytes Shift-JIS, porque essa é a codificação antiga que a maioria dos sistemas governamentais e bancários japoneses ainda usa internamente — então planeje 2 bytes por caractere de largura total. Dígitos e letras latinas de largura total (0123, ABC) custam 2 bytes Shift-JIS cada, enquanto suas versões de meia largura custam 1, então normalizar para meia largura antes do envio costuma economizar espaço. Emoji contam como 4 bytes UTF-8 e costumam ser rejeitados por formulários antigos. Para tweets e outros sistemas baseados em Unicode, a contagem UTF-8 é o que importa. Se você precisa de uma contagem de palavras para japonês, lembre-se de que o japonês não tem espaços, então uma contagem de palavras dividida por espaços é não confiável — a contagem de caracteres é a métrica padrão. Para limpar a largura antes de contar, passe o texto pelo conversor de kana primeiro.

Ferramentas Relacionadas

Fontes e Referências

Limitações

Ad