🔡 Contatore di Caratteri Giapponesi (文字数・バイト数)
Incolla testo giapponese per contare i caratteri (con e senza spazi), i byte in UTF-8 e Shift-JIS, le righe e i caratteri a tutta/mezza larghezza all'istante.
Che cos’è questo strumento?
Contare il testo in giapponese non è semplice come sembra. Un singolo "carattere" può essere una lettera latina a mezza larghezza (1 byte in Shift-JIS), una kana o un kanji a tutta larghezza (2 byte in Shift-JIS) oppure una lettera latina a tutta larghezza (anch'essa 2 byte). Moduli, database e i sistemi giapponesi più datati spesso impongono limiti espressi in conteggi di byte anziché di caratteri, quindi una stringa che sta in 30 caratteri può sforare un campo di 30 byte. Conoscere sia il conteggio dei caratteri che quello dei byte — sia in UTF-8 che in Shift-JIS — è essenziale per compilare moduli web giapponesi, dimensionare colonne di database e scrivere testi come SMS o tweet.
Questo contatore di caratteri giapponesi riporta il conteggio dei caratteri con e senza spazi, il numero di righe, il conteggio dei byte UTF-8, il conteggio dei byte Shift-JIS e la distinzione tra caratteri a tutta e a mezza larghezza. È pensato per chi scrive testi localizzati in giapponese, per gli sviluppatori che dimensionano campi di database e per chiunque compili un modulo governativo o bancario giapponese con limite di byte. Per le attività correlate di conversione delle kana o romanizzazione del testo, usa il convertitore di kana e il convertitore romaji.
Fai riferimento alla tabella sottostante per vedere come i diversi tipi di carattere contribuiscono ai conteggi:
| Tipo di carattere | Esempio | Byte UTF-8 | Byte Shift-JIS |
|---|---|---|---|
| ASCII (latino a mezza larghezza) | A, 1, ! | 1 | 1 |
| Latino a tutta larghezza | A, 1, ! | 3 | 2 |
| Hiragana / Katakana | あ, ア | 3 | 2 |
| Kanji (CJK) | 日, 本, 語 | 3 | 2 |
| Katakana a mezza larghezza | ア, イ, ウ | 3 | 1 |
| Emoji | 😀 | 4 | n/a |
Come funziona
Il contatore scorre l'input una sola volta e, per ogni carattere, registra la sua lunghezza in byte UTF-8 (1 per ASCII, 2 per il supplemento Latin-1 e il greco, 3 per kana, kanji e la maggior parte dei simboli, 4 per gli emoji e i caratteri del piano astral) e la sua lunghezza in byte Shift-JIS (1 per ASCII e katakana a mezza larghezza, 2 per kana a tutta larghezza, kanji e latino a tutta larghezza). Inoltre classifica ogni carattere come a tutta larghezza o a mezza larghezza controllandone il blocco Unicode e conta spazi e interruzioni di riga separatamente, così puoi ottenere un totale "senza spazi".
La tabella sottostante elenca gli intervalli Unicode usati per classificare la larghezza:
| Larghezza | Blocchi Unicode | Contenuti tipici |
|---|---|---|
| Mezza larghezza | U+0000–U+007F, U+FF61–U+FFDC | ASCII, katakana a mezza larghezza |
| Tutta larghezza | U+3040–U+30FF, U+4E00–U+9FFF, U+FF00–U+FF60 | kana, kanji, latino a tutta larghezza |
| Altro | emoji, segni diacritici | contati per lunghezza in byte UTF-8 |
Tutto il conteggio avviene localmente nel tuo browser, quindi anche testi sensibili non escono mai dal tuo dispositivo. Per preparare prima il testo — normalizzare la larghezza, convertire le kana o romanizzare — abbina questo strumento al convertitore di kana e al convertitore romaji, oppure verifica le letture con il cercatore di lettura dei kanji.
Come usare
- Incolla il testo giapponese (o misto) nella casella di input.
- I contatori si aggiornano all'istante mentre scrivi o incolli.
- Controlla il conteggio dei caratteri con e senza spazi.
- Controlla i conteggi di byte UTF-8 e Shift-JIS per i limiti dei moduli o dei database.
- Usa la distinzione a tutta/mezza larghezza per pianificare la normalizzazione della larghezza.
Domande Frequenti
Perché esistono due conteggi di byte diversi?
I diversi sistemi codificano il giapponese in modi diversi. Le pagine web moderne usano UTF-8 (dove un kanji è 3 byte), mentre molti vecchi sistemi governativi e bancari giapponesi usano Shift-JIS (dove un kanji è 2 byte). Lo strumento riporta entrambi così puoi abbinarti al sistema che controlla il tuo input.
Quando un modulo dice che accetta 30 byte, a quale codifica si riferisce?
Quasi sempre ai byte Shift-JIS, perché quella è la codifica legacy che i back-end giapponesi usano ancora. In tal caso pianifica 2 byte per ogni carattere a tutta larghezza.
Come vengono contati gli emoji?
Gli emoji sono di solito 4 byte in UTF-8 e non sono rappresentabili nel Shift-JIS di base, quindi spesso causano il rifiuto dell'input da parte dei moduli legacy. Il contatore mostra il loro costo in byte UTF-8 così puoi individuarli.
Conta anche le parole oltre ai caratteri?
Si concentra su caratteri e byte perché il giapponese non ha spazi tra le parole, rendendo inaffidabile un conteggio per spazi. Il conteggio dei caratteri è la metrica di lunghezza standard per il testo giapponese.
Qual è la differenza tra tutta e mezza larghezza?
I caratteri a mezza larghezza (A, 1, ア) sono stretti e costano 1 byte Shift-JIS; quelli a tutta larghezza (A, 1, ア, 日) sono larghi e costano 2. I latini e le cifre a tutta larghezza sono prodotti dagli IME giapponesi e sono spesso normalizzati a mezza larghezza prima dell'invio.
Il mio testo viene inviato a un server?
No. Tutto il conteggio avviene nel browser con JavaScript. Nulla viene caricato, memorizzato o registrato, quindi è sicuro incollare testo privato o bozze.
Consigli
Quando un modulo giapponese indica che accetta "30 byte", quasi sempre intende byte Shift-JIS, perché quella è la codifica legacy che la maggior parte dei sistemi governativi e bancari usa ancora internamente — quindi pianifica 2 byte per ogni carattere a tutta larghezza. Cifre e lettere latine a tutta larghezza (0123, ABC) costano 2 byte Shift-JIS ciascuna, mentre le loro versioni a mezza larghezza ne costano 1, quindi normalizzare a mezza larghezza prima dell'invio fa spesso risparmiare spazio. Gli emoji contano come 4 byte UTF-8 e sono di solito rifiutati dai moduli legacy. Per tweet e altri sistemi consapevoli di Unicode, conta il numero UTF-8. Se ti serve un conteggio delle parole per il giapponese, ricorda che il giapponese non ha spazi, quindi un conteggio per spazi è inaffidabile — il conteggio dei caratteri è la metrica standard. Per uniformare la larghezza prima di contare, passa il testo prima dal convertitore di kana.
Strumenti Correlati
Convertitore Hiragana-Katakana
Converti hiragana in katakana e viceversa all'istante nel browser. Convertitore
Convertitore Romaji
Converti hiragana e katakana in romaji con Hepburn, Kunrei-shiki o Nihon-shiki.
Generatore di Furigana
Aggiungi letture furigana sopra i kanji nel testo giapponese. Generatore gratuit
Assistente Okurigana
Verifica la grafia corretta degli okurigana per verbi e aggettivi giapponesi com
Cercatore di Lettura dei Kanji
Cerca le letture onyomi e kunyomi di qualsiasi kanji comune. Strumento gratuito
Contatore di Caratteri
Conta caratteri, parole, frasi e paragrafi all'istante. Contatore di caratteri g
Contaparole
Conta parole, caratteri, frasi, paragrafi e tempo di lettura online gratis. Idea
Fonti e Riferimenti
- Unicode Standard, Chapter 3 — encoding model for CJK characters (full-width U+FF01-FF5E vs half-width U+0021-007E)
- JEITA (Japan Electronics and Information Technology Industries Association), "Shift-JIS character encoding standard"
Limitazioni
- UTF-8 byte counts are exact for all Unicode characters. Shift-JIS byte counts assume the character is representable in Shift-JIS; characters outside the Shift-JIS range (e.g., some emoji) are counted as 3 bytes.