>> Read No. 9523 article  
[질문] 2바이트 문자 다룰때 레귤라 익스프레션....

등록 2000-10-26 14:03:00     조회 2
이름 정원창    

		안녕하세요.
 여기에 질문드려도 될까 모르겠네요.
 펄의 레귤라 익스프레션에서 궁금한 것이 있어서 질문 드립니다.
지금 제가 '일본어용 한자'를 다루고 있는데요,
(물론 일본어 캐릭터 셋입니다.)
예를 들어,
 if ( $a = /韓/ )
 이런 표현을 쓸 일이 많이 있습니다.
$a안에 韓이라는 글자가 포함되는지를 검사하게 되겠죠.
그런데 펄은 2바이트 문자를 잘 처리하지 못하므로,
위와 같은 경우는 1바이트 문자 두개를 검색하는 것으로 인식합니다.
물론 대개의 경우에는 이렇게 해도 별 문제가 없는데,
어떤 한자의 경우는 뒷부분 1바이트가 대괄호 [ 혹은 ]에 해당하고,
어떤 한자는 백슬래쉬 에 해당하는 경우가 있는 모양입니다.
이런 경우는 regular expression안에 부적절하게 [ ]나 를 사용했다는
에러메시지가 뜨면서 프로그램이 종료됩니다.
컴퓨터 입장에서는 /韓/이라는 표현이
/a]/혹은 /a/로 간주되는 모양입니다.
(물론 韓이라는 글자가 에러가 난다는 것은 아니구요. 예를 든것입니다.
 실제로는 夕,十,啓등등의 글자들이 에러가 납니다.)
  이런 경우에 해당하는 한자는 도저히 검색할 수가 없더군요.
 책등을 찾아보니, 2바이트 문자와 1바이트 문자 모두
각각 한글자로 처리하게 도와주는 트릭등이 있던데,
레귤라 익스프레션에서 사용할 경우는 도움이 안되더군요.
  어떤 트릭등을 이용해서 이런 경우를 빠져나오는 수가 있을 법도 한데...
고수님들의 조언을 부탁드립니다.
이름
암호
Register [ localhost 목록보기 윗글 아랫글
글쓰기
답장쓰기 수정 삭제
정규표현식 [ 상세 검색 ]
페이지로딩: [ 13.72 초 ] 작업시간: [ 13.23 초 ]

Copyleft 1999-2026 by JSBoard Open Project
Theme Designed by IDOO All right reserved
[TOP]

적수네 동네
+
| 적수네 동네
| 공부방
| 리눅스 잡지 서고
| LSN 소스
| 링크 모음
+---+
게시판
+
| 떠들어보세!
| 질문과 답변
| 새소식과 정보
| 1원짜리 팁?
| 대화방
+---+
칼럼?
+
| 세하 훔쳐보기
| Welcome2nite
| 혜진의 염장판
+---+
리눅스 상표권
+
| 반대 서명란
| 토론 게시판
+---+
GNU
+
| GNU 선언문
| GNU GPL
| GNU 미러 목록
+---+
프로젝트?
+
| 리눅스카운터
| RC5DES
| 실질헌법 제작
+---+
커널 소식
+
| 안정 버젼: 2.4.14
+---+
테마 선택
+
LSN 방송국?
+
| OFF AIR
+---+
회원
+
| 로그인
+---+
[ 적수네 동네 ] [ 리눅스 상표권 독점 반대 ] [ 한글 리눅스 문서 프로젝트 ] [ KrLine ] [ 사랑넷 ] [ Valid HTML 4.0! ] [ SlashDot ] [ Freshmeat ]
Copyleft (C) 1998-2001 Byeong-Chan Kim . License
TIME: 1789746501
System by WYZsoft, HDD by I.O.Linux, Mizi Research, Embryo, WOWLINUX, Domain by SarangNet, Network by KrLine.