タグ

charsetに関するtarchanのブックマーク (47)

  • Unicode 版美乳テーブルを探せ

    美乳テーブルとは 「美乳テーブル」という物がある。 「EUC-JP の文章を Shift_JIS だと誤認識されない様に、EUC-JP 固有のバイト値を文章先頭付近に埋め込んでおく」という物。 具体的に、Shift_JIS には 0xFD と 0xFE が現れず、EUC-JP にはそれが現れるので、その値を含む文字コードを書いておこうという事で、その文字の集合に付いた名前。 “美” = 0xC8FE、“乳” = 0xC6FD。 各文字エンコーディングの事情 但し、これは EUC-JP での話。 一応、文章の先頭付近に日語の文字を書いておくのは、他の文字エンコーディングでも認識のヒントにはなるけど。 逆に「Shift_JIS の文章を EUC-JP だと誤認識されない様にする」には、EUC-JP にはないバイト値の 0x80〜0xA0 を書けばいいんだろうけど、これは沢山ありそうだから、慎

  • Gmailが日本語など非アルファベット文字を含むメールアドレスとの送受信に対応

    Google日、日語を含む非アルファベット文字を使うメールアドレスとの送受信に対応させると発表しました。 Official Google Blog: A first step toward more global email http://googleblog.blogspot.jp/2014/08/a-first-step-toward-more-global-email.html 従来、メールアドレスに使える文字はAからZまでのラテン文字(アルファベット)だけで、非アルファベットを使用した場合、Gmailから認識することはできず、メールの送受信は不可能でした。この状況を改善して、Googleは日語や中国語、アクセントつきのラテン特殊文字などをGmail側から認識できるようにしました。これにより、例えば、「武@メール.グーグル」というメールアドレスからのメールを受信でき、またこの

    Gmailが日本語など非アルファベット文字を含むメールアドレスとの送受信に対応
    tarchan
    tarchan 2014/08/07
    >非アルファベット文字を使用したメールアドレスが一般的になるためには、Google以外のメールサービスが非アルファベット文字へ対応することが必要となるため、すぐに恩恵を受けることはなさそうです。
  • 全角半角混在の文章で 1 行に半角何文字分あるか調べる方法

    「ソースコードは 1 行あたり 80 文字以内」とか「コミットログは横幅 72 文字以内」とか、文字数に関するルールはいろいろある。 ルールを徹底するには機械的に判定したい。と思って、簡単なスクリプトを書こうとした瞬間、意外と「1 行あたりの文字数」をカウントするのが難しいことに気付いた。 たとえば、「あA」は「全角 1 文字+半角 1 文字」なので半角 3 文字分としてカウントしたい。 しかし、UTF-8 の世界では「あA」の文字長は 2 だし、バイト数は 4 (あ=0xE38182、a=0x41) である。 EUC-JP や Shift-JIS の時代なら、単純に「あA」は 3 バイトなので「半角 3 つ分」とすぐ分かったのだけども… (逆に文字長を調べるのが面倒だった)。 はて、どうするか? というのがこの記事でいいたいこと。 East Asian Width を見よ いろいろとググ

    全角半角混在の文章で 1 行に半角何文字分あるか調べる方法
    tarchan
    tarchan 2014/03/28
    >East Asian Width で EastAsianWidth.txt という資料が紹介されている。この資料では、全ての文字の横幅が 6 つのカテゴリーに分類されている。
  • Unicodeの似た文字を整理してみた - y-kawazの日記

    XMLやCSV等のデータをJavaで色々加工して出力したりといったことをしてると必ずハマるのが波線などの文字化け問題です。 文字化けが発覚するたびにググって場当たり的な対処を繰り返すのに疲れたのでよく問題になる文字と形が似た文字をリストアップして、更にそれをJavaで各種エンコーディングに変換したらどの文字になるかを頑張って纏めました。 ついでに文字化けしないよう上手いこと出力可能な文字に置換する関数も作ってみました。 Javaの変換テーブル 表中の U,S,W,E,J はそれぞれ、UTF-8、Shift_JIS、Windows-31J、EUC-JP、ISO-2022-JP で出力した際の文字です。 見た目で分からないくらい似た文字ばかりなので、各セルにマウスカーソルを乗せたらツールチップで確認できるようtitleにコードポイントを書いておきました。 分かりやすいよう、青は文字化けなし、黄

    Unicodeの似た文字を整理してみた - y-kawazの日記
  • i.softbank.jpから送信した絵文字のフォールバック - 帰ってきた💫Unicode刑事〔デカ〕リターンズ

    SoftBank iPhoneのメールアプリで@i.softbank.jpアドレスから絵文字入りのメールを送信すると、charset=Shift_JISになる*1。このため、SoftBank絵文字との対応関係を持たない絵文字は、すべて比較的意味合いの似た絵文字または「〓」に置き換えられる。このフォールバック処理は、サーバではなくiPhone側で行われるので、書きかけのメールを下書き保存して開き直しただけで絵文字が置き換えられている。 下図は、@i.softbank.jpアドレスから送信すると他の絵文字に置き換えられる絵文字のリスト。 下図は、@i.softbank.jpアドレスから送信すると「〓」に置き換えられる絵文字のリスト。ざっと見たかんじ「これなら『〓』にするよりは他の絵文字に置き換えたほうがいいんじゃないの?」という例もいくつかある。 対策は、文字化けを防ぐ万能の呪文「♡」「⌘」「

    i.softbank.jpから送信した絵文字のフォールバック - 帰ってきた💫Unicode刑事〔デカ〕リターンズ
  • なんたら統一文字の面積比の正確な図 - 帰ってきた💫Unicode刑事〔デカ〕リターンズ

    戸籍統一文字、住基ネット統一文字、登記統一文字に含まれる漢字の数について、面積比が正確になるように図を描いてみた*1。 法務省が戸籍のオンライン手続きのために整理した文字集合が、戸籍統一文字。この戸籍統一文字を拡張した文字集合が登記統一文字であり、拡張部分を登記固有文字と呼ぶ。図にすると、こんなかんじ。 総務省の住民基台帳ネットワーク統一文字(住基ネット統一文字)には、法務省の戸籍統一文字・登記統一文字との互換性はない。図にすると、こんなかんじ。 この図に、JIS X 0208とJIS X 0213も入れてみる。住基ネット統一文字は基的にJIS X 0213ベースだが、「JIS X 0213に含まれていて戸籍統一文字に含まれていない漢字」は、けっこうある。 IPAの文字情報基盤整備事業が対象としているのは、オレンジ色の枠で囲んだ部分。登記固有文字がんばれ。 *1:使っている数字は、『汎

    なんたら統一文字の面積比の正確な図 - 帰ってきた💫Unicode刑事〔デカ〕リターンズ
  • Playframeworkでガラケーサイト

    こんにちは。 今日はPlayframeworkでガラケーサイトを作成した話をしてみたいと思います。 ちなみにガラケー対応をやったのは人生初です。(^^;;; そんなに凝ったページではなかったんですが、ガラケー界のしきたり(?)とPlayの思想がそぐわない部分があってそこで多少面倒があったのでその部分の情報共有です。(読み直したら愚痴みたいになってますけど。。。(--) ★charsetはShift_JIS 知っている人からすれば当たり前の話なんでしょうがガラケー界では今もWebページはShift_JISで作成するのが常識のようです。 実際試してみると手元で試した端末はすべてUTF-8のページも表示できましたが、古い端末は化けると聞けばそこで冒険するのはまだ危険かと思います。 ちなみに世の慣習にならって「Shift_JIS」と言っていますが実際にはガラケーの文字コードはMS932+絵文字です

    tarchan
    tarchan 2013/03/04
    >「あめりか」は化けないけど「アメリカ」は化ける
  • いいから聞け! 俺が文字コードについて教えてやるよ Advent Calendar 特別編 - 谷本 心 in せろ部屋

    長らく更新の止まっている「いいから俺文字コード」シリーズですが、 このたび、Java Advent Calendarの一環として復活させました! Java Advent Calendarって? エントリーはJava Advent Calendarの5日目です。 Java Advent Calendarについては、以下のサイトをご覧ください。 http://atnd.org/events/22434 前の4日目は @akirakoyasu さんの「SDKで身近になるAmazon Web Service」 http://www.akirakoyasu.net/2011/12/04/easily-use-aws-through-sdk/ S3、SimpleDBSESの使い方をサンプルコードつきで紹介しています。 次の6日目は @shuji_w6e さんの「JUnit のセカイ」 http:/

    いいから聞け! 俺が文字コードについて教えてやるよ Advent Calendar 特別編 - 谷本 心 in せろ部屋
  • いいから聞け! 俺が文字コードについて教えてやるよ その1(前提知識編) - 谷本 心 in せろ部屋

    ちょっと久々のJavaネタですが、 前から書き溜めていた、文字コードやエンコードについてのノウハウを書きます。 今回は、詳細な説明に入る前に、前提になる知識や用語について説明しておきます。 文字コードとエンコードって違うの? 新人くん「では、HTMLの文字コードはUTF-8でお願いします」 先輩社員「文字コードじゃなくてエンコーディングでしょ?」 新人くん「えっ。あぁ、はい、それで」 文字コードとエンコード(エンコーディング)を混同して使ったりすると、 ちょっと原理主義的な人に怒られたりするんですけど、 大まかに言えば、「文字コード」は文字に割り当てられた「数字」のことで、 「エンコード」は文字と数字をマッピングする「方式」のことだと捉えていれば、大きくは外れません。 ただ、「文字コード」という言葉は、「数字」「方式」の両方で使われるほか、 文字一覧を示す「Charset」という意味で使わ

    いいから聞け! 俺が文字コードについて教えてやるよ その1(前提知識編) - 谷本 心 in せろ部屋
  • 4.文字セット (4)

    4.4. CharsetDecoderクラス CharsetDecoderクラスは各種文字セットの文字列をUnicode文字列に変換するためのクラスです。CharsetDecoderインスタンスは、対応するCharsetインスタンスのnewDecoder()メソッドを呼び出すことによって取得できます。 CharsetDecoderクラスの使用方法は、CharsetEncoder と変換の方向が違うだけで、ほとんど同じです。 文字列のデコードを行うメソッドは、以下の2つ存在します。 CoderResult decode(ByteBuffer in, CharBuffer out, boolean endOfInput) CharBuffer decode(ByteBuffer in) 引数が1つのメソッドは、CharsetEncoder クラスの encode メソッドの場合と同じく簡易メソ

  • 終了いたしました。

    作者ホームページサービス(hp.vector)は終了いたしました。 長らくのご利用、ありがとうございます。 ご不明な点があれば、お問い合わせページをご覧の上、お問い合わせください。 ※15秒後にトップページに戻ります。 (c) Vector HOLDINGS Inc.All Rights Reserved.

  • 「iPhoneのMailから送ったメッセージ全体が文字化け」のまとめ - 帰ってきた💫Unicode刑事〔デカ〕リターンズ

    (2013年10月追記1)iOS 7の登場以来、このエントリへのアクセスが増えているので、情報を追加。iSO 7では、以前はauのiPhoneなどでしか発生しなかった「送信したcharset=CP932のメールが、Android端末で化ける」現象が、SoftBank iPhoneでも発生するようになった。詳しくは「iOS 7にしたら送信したメッセージが化けるようになった」を参照。 (2013年10月追記2)実際に確認できてはいないのだが、iOS 7の仕様変更により、iPhoneのメールアプリからSoftBankのケータイに絵文字を含むメールを送った場合、メッセージ全体が化けるのではないかと思われる(これに該当する経験をお持ちの方、コメント欄などで情報をいただけるとありがたいです)。 (2013年10月追記3)iOS 7がらみで(メッセージ全体が化けるのではなく)絵文字が表示されない問題につ

    「iPhoneのMailから送ったメッセージ全体が文字化け」のまとめ - 帰ってきた💫Unicode刑事〔デカ〕リターンズ
  • iPhoneの文字化けを防ぐ魔法の呪文 - 帰ってきた💫Unicode刑事〔デカ〕リターンズ

    昨日のエントリ(「iPhoneのMailから送ったメッセージ全体が文字化け」のまとめ)読みましたよー。iPhoneから送るメールの文字化け防止策は、署名に「♡」を入れておけばOKなんですよね? うん。ただまあ、ちょっと気にする人はいるかもなあ。 男子に誤解されちゃう、と? いや、そういうのじゃなくて、つまり、化けちゃうんだよね。 えっ? 相手の環境によっては「♡」が化けるんだよ。 何ですかそれ。文字化け対策で入れた文字が化けたら意味ないじゃないですか。 意味はあるよ。iPhoneから送ったメールは相手先で全体が化けて読めなくなる可能性があるけど、「♡」でcharset=UTF-8にしておけば、この「全体化け」を防げるんだから。ただし、相手がケータイだったりすると、「♡」自体は「・」とか「?」とかになっちゃうってこと。 自らは捨て石となってメッセージ全体を救うということですか。UTF-8にな

    iPhoneの文字化けを防ぐ魔法の呪文 - 帰ってきた💫Unicode刑事〔デカ〕リターンズ
    tarchan
    tarchan 2012/05/24
    >バケヌくんを試してみたい方は、こちらをコピーしてご利用ください。  (‾―‾)/
  • SoftBank iPhoneのShift_JISがすごいことになっている件 - 帰ってきた💫Unicode刑事〔デカ〕リターンズ

    下図は、SoftBank iPhoneのMailが用いるShift_JISのIBM拡張文字領域*1。どうだ、驚いたろう。 SoftBank iPhoneのMailは、charset=Shift_JISをよく使う。髙村薫の「髙」や宮﨑あおいの「﨑」などのWindows外字もShift_JISで送るし、絵文字もShift_JISで送る。しかし、WindowsのIBM拡張文字領域とSoftBankの絵文字領域は、もともと衝突しており、共存できない。なので、SoftBank iPhoneのShift_JISでは、IBM拡張文字のうち下図ピンク部分が使えない。 だったらその分は、NEC選定IBM拡張文字のほうを使えばいいじゃないですか、どうせダブってるんだから(下図)。というのが、大ざっぱに言えば、SoftBank iPhoneのMailが用いるShift_JISである。 その外字領域をまとめると、

    SoftBank iPhoneのShift_JISがすごいことになっている件 - 帰ってきた💫Unicode刑事〔デカ〕リターンズ
  • アプリケーション開発ソフトウェア | 富士通

    富士通は、企業のIT基盤を支える多岐にわたるソリューション製品群を提供します。 これらは、データ処理の高速化、既存システムの効率的な活用、文字コードの適切な管理、帳票出力・管理までをカバーします。企業活動における様々な課題に対応し、業務の最適化と生産性向上を実現することで、お客様のデジタルトランスフォーメーションを強力に推進します。

    アプリケーション開発ソフトウェア | 富士通
  • Unicodeは文字集合か符号化方式か : 404 Blog Not Found

    2006年11月24日12:30 カテゴリLightweight Languages Unicodeは文字集合か符号化方式か 以下は、電脳で文字を扱う場合の基礎中の基礎なのだが、肝心の記事に重大な誤りがいくつもある。 文字コード規格の基礎:ITpro そろそろ具体的な説明に入ろう。最初にはっきりさせておく必要があるのは次の点だ。一般に「文字コード」と言う場合, 文字の集合 エンコード方法 という要素がある。この二つを区別して考えることが重要だ。もちろん大きな関連はあるのだが,ごちゃごちゃのままでは「わからなく」なる大きな要因となる。ここだ。 これによると、Unicodeは明らかに「エンコード方法」であるが、これは間違い。ここで書かれているものはUCS-2という名前のUnicodeが定めるいくつかの「エンコード方法」の一つであり、しかもUTF-16によって陳腐化した方式である。 まずUnic

    Unicodeは文字集合か符号化方式か : 404 Blog Not Found
    tarchan
    tarchan 2011/07/03
    >Unicodeと一言で言った場合は、文字集合を指すことが多いし、またそうあるべきである。符号化方式を指す場合は、UTF-7,UTF-8,UTF-16,UTF-32という呼び名を使うべきである。
  • Excelマクロ「ファイル」メモ(Hishidama's Excel "file" Memo)

    S-JIS[2011-05-24] 変更履歴 Excelマクロでファイル出力 Excelマクロ(VBA)でファイルを出力する方法。 Shift_JISでファイル出力 UTF-8でファイル出力 Shift_JISでファイル出力 ごく普通の(昔ながらのBASICでの)ファイル出力方法。 MSX-BASIC時代から存在するOPEN~PRINT#を使う。 WindowsExcel2003の文字コードはシフトJIS(たぶんMS932)なので、出力したファイルはSJISとなる。 Dim fno As Integer fno = FreeFile Open "c:\temp\excel_vba_sjis.txt" For Output As #fno 'データ出力 Print #fno, "データ1"; ","; "データ2" Print #fno, "データ2"; ","; "データ3" Close

  • iPhone文字化け対策(暫定策) - 西貢太郎(saigon-taro)の日記

    出先からiPhoneでメールに返信するとよく「文字化けしているので再送して下さい」と言われます。 この場合相手のメールソフトでエンコードをUTF-8に変更してもらうとちゃんと読めるようになりますが、 メールソフトの設定変更が分かりにくい そもそもエンコードって何?、という人も多い 相手によっては気軽に設定変更をお願いできない などの問題があり出先でのメールはBlackBerryを併用してきました。 しかし、もうすぐiPadもやってくるし、できればiPadだけで運用したいな、と思い、改めて対策を探してみると見つかりました。 参考にしたのは下記サイト。 文に絵文字を含めることで強制的にISO-2022-JPでメール送信出来ます。この特性を利用してiPhoneの署名に差し障りの無い絵文字を1文字あらかじめ設定しておくことで、以降は文字化けの心配がなくなります。iPhoneの署名設定画面では絵文

    iPhone文字化け対策(暫定策) - 西貢太郎(saigon-taro)の日記
    tarchan
    tarchan 2011/05/11
    試してみよう>本文に絵文字を含めることで強制的にISO-2022-JPでメール送信出来ます。
  • KEIS - Wikipedia

    この記事は検証可能な参考文献や出典が全く示されていないか、不十分です。 出典を追加して記事の信頼性向上にご協力ください。(このテンプレートの使い方) 出典検索?: "KEIS" – ニュース · 書籍 · スカラー · CiNii · J-STAGE · NDL · dlib.jp · ジャパンサーチ · TWL (2022年4月) KEIS(ケイス、Kanji processing Extended Information System)は日立製作所が開発した日語処理システムの名前である。実際上は、『KEIS』という用語は、そのシステム上で使われる漢字コードの事を指していることが多いため、項ではその漢字コードについて説明する。 『KEIS』コードは、JIS C 6226-1978もしくはJIS X 0208-1983をGR表現し、その上方に拡張文字を登録した符号化文字集合である。 こ

  • Loading...