← 首页

🔡 日文字符计数器(文字数・バイト数)

贴上日文文本,即时计算字符数(含和不含空格)、UTF-8 和 Shift-JIS 字节数、行数,以及全角与半角字符统计。

这是什么工具?

计算日文文本并不像看起来那么简单。一个"字符"可以是半角拉丁字母(Shift-JIS 中 1 字节)、全角假名或汉字(Shift-JIS 中 2 字节),或全角拉丁字母(也是 2 字节)。表单、数据库和旧式日文系统通常以字节数而非字符数表示限制,因此一个 30 字符的字符串可能会超出 30 字节的字段。同时了解字符数和字节数——包括 UTF-8 和 Shift-JIS——对于填写日文网页表单、设计数据库字段以及编写短信或推文长度的文案至关重要。

这个日文字符计数器报告含和不含空格的字符数、行数、UTF-8 字节数、Shift-JIS 字节数,以及全角与半角字符的分类统计。它专为将文案本地化为日文的写作者、设计数据库字段的开发者,以及任何填写有字节限制的日本政府或银行表单的人而设计。如需转换假名或罗马字化文本的相关任务,请使用假名转换器和罗马字转换器。

请参考下表,了解不同字符类型如何影响计数:

字符类型示例UTF-8 字节Shift-JIS 字节
ASCII(半角拉丁)A, 1, !11
全角拉丁A, 132
平假名/片假名あ, ア32
汉字日, 本32
表情符号😀4N/A

运作原理

计数器遍历输入一次,对每个字符记录其 UTF-8 字节长度(ASCII 为 1,拉丁补充和希腊字母为 2,假名、汉字和大多数符号为 3,表情符号和星空平面字符为 4)及其 Shift-JIS 字节长度(ASCII 和半角片假名为 1,全角假名、汉字和全角拉丁为 2)。它还通过检查 Unicode 区块将每个字符分类为全角或半角,并分别计算空格和换行符,以便你获得"不含空格"的总数。

下表列出了用于分类宽度的 Unicode 范围:

宽度Unicode 区块典型内容
半角U+0000–U+007F, U+FF61–U+FFDCASCII、半角片假名
全角U+3040–U+30FF, U+4E00–U+9FFF, U+FF00–U+FF60假名、汉字、全角拉丁
其他表情符号、组合标记按 UTF-8 字节长度计算

所有计数都在你的浏览器中本地执行,因此即使敏感文本也不会离开你的设备。

Ad

使用方法

  1. 将你的日文(或混合)文本贴上到输入框中。
  2. 随着你输入或贴上,计数器即时更新。
  3. 查看含和不含空格的字符数。
  4. 查看 UTF-8 和 Shift-JIS 字节数以了解表单或数据库限制。
  5. 使用全角与半角分类统计来规划宽度归一化。

常见问题

为什么有两种不同的字节计数?

不同系统以不同方式编码日文。现代网页使用 UTF-8(汉字为 3 字节),而许多旧式日本政府和银行系统使用 Shift-JIS(汉字为 2 字节)。工具同时报告两者,以便你匹配正在检查你输入的系统。

当表单说它接受 30 字节时,指的是哪种编码?

几乎总是指 Shift-JIS 字节,因为这是日本后端系统仍在使用的旧式编码。在这种情况下,请按每个全角字符 2 字节来规划。

表情符号如何计数?

表情符号在 UTF-8 中通常为 4 字节,在基本 Shift-JIS 中无法表示,因此它们经常导致旧式表单拒绝输入。计数器显示其 UTF-8 字节成本以便你发现它们。

它也计算字数吗?

它专注于字符和字节,因为日文单词之间没有空格,使得空格分割的字数统计不可靠。字符数是日文文本的标准长度指标。

全角和半角有什么区别?

半角字符(A, 1, ア)较窄,花费 1 个 Shift-JIS 字节;全角字符(A, 1, ア, 日)较宽,花费 2 个。全角拉丁和数字由日文 IME 产生,通常在提交前归一化为半角。

我的文本会被传送到服务器吗?

不会。所有计数都在你的浏览器中以 JavaScript 执行。没有任何内容被上传、存储或记录,因此可以安全地贴上私人草稿文本。

技巧与建议

当日文表单说它接受"30 字节"时,几乎总是指Shift-JIS 字节,因为这是大多数政府和银行系统仍在内部使用的旧式编码——因此请按每个全角字符 2 字节来规划。全角数字和拉丁字母(0123, ABC)每个花费 2 个 Shift-JIS 字节,而它们的半角双胞胎只需 1 个,因此在提交前归一化为半角通常可以节省空间。表情符号计为 4 个 UTF-8 字节,通常被旧式表单拒绝。对于推文和其他 Unicode 感知的系统,UTF-8 计数才重要。如果你需要日文的字数统计,请记住日文没有空格,因此空格分割的字数统计不可靠——字符数才是标准指标。如需在计数前清理宽度,请先通过假名转换器处理文本。

相关工具

来源与参考

限制与免责声明

Ad