5.16 增加或改�已打开文件的编�¶

问题¶

你想在�关闭一个已打开的文件��下增加或改�它的Unicode编�。

解决方案¶

如果你想给一个以二进制模�打开的文件添加Unicode编�/解�方�, �以使用 io.TextIOWrapper() 对象包装它。比如:

import urllib.request
import io

u = urllib.request.urlopen('http://www.python.org')
f = io.TextIOWrapper(u, encoding='utf-8')
text = f.read()

如果你想修改一个已�打开的文本模�的文件的编�方�,�以先使用 detach() 方法移除掉已存在的文本编�层, 并使用新的编�方�代替。下�是一个在 sys.stdout 上修改编�方�的例�:

>>> import sys
>>> sys.stdout.encoding
'UTF-8'
>>> sys.stdout = io.TextIOWrapper(sys.stdout.detach(), encoding='latin-1')
>>> sys.stdout.encoding
'latin-1'
>>>

这样��能会中断你的终端,这里仅仅是为了演示而已。

讨论¶

I/O系统由一系列的层次构建而�。你�以试��行下�这个�作一个文本文件的例��查看这�层次:

>>> f = open('sample.txt','w')
>>> f
<_io.TextIOWrapper name='sample.txt' mode='w' encoding='UTF-8'>
>>> f.buffer
<_io.BufferedWriter name='sample.txt'>
>>> f.buffer.raw
<_io.FileIO name='sample.txt' mode='wb'>
>>>

在这个例�中,io.TextIOWrapper 是一个编�和解�Unicode的文本处�层, io.BufferedWriter 是一个处�二进制数�的带缓冲的I/O层, io.FileIO 是一个表示�作系统底层文件�述符的原始文件。 增加或改�文本编�会涉�增加或改�最上�的 io.TextIOWrapper 层。

一般�讲,�上�例�这样通过访问属性值�直接�作��的层是很�安全的。 例如,如果你试�使用下�这样的技术改�编�看看会�生什么:

>>> f
<_io.TextIOWrapper name='sample.txt' mode='w' encoding='UTF-8'>
>>> f = io.TextIOWrapper(f.buffer, encoding='latin-1')
>>> f
<_io.TextIOWrapper name='sample.txt' encoding='latin-1'>
>>> f.write('Hello')
Traceback (most recent call last):
    File "<stdin>", line 1, in <module>
ValueError: I/O operation on closed file.
>>>

结果出错了,因为f的原始值已�被破�了并关闭了底层的文件。

detach() 方法会断开文件的最顶层并返回第二层,之�最顶层就没什么用了。例如:

>>> f = open('sample.txt', 'w')
>>> f
<_io.TextIOWrapper name='sample.txt' mode='w' encoding='UTF-8'>
>>> b = f.detach()
>>> b
<_io.BufferedWriter name='sample.txt'>
>>> f.write('hello')
Traceback (most recent call last):
    File "<stdin>", line 1, in <module>
ValueError: underlying buffer has been detached
>>>

一旦断开最顶层�,你就�以给返回结果添加一个新的最顶层。比如:

>>> f = io.TextIOWrapper(b, encoding='latin-1')
>>> f
<_io.TextIOWrapper name='sample.txt' encoding='latin-1'>
>>>

尽管已��你演示了改�编�的方法, 但是你还�以利用这�技术�改�文件行处��错误机制以�文件处�的其他方�。例如:

>>> sys.stdout = io.TextIOWrapper(sys.stdout.detach(), encoding='ascii',
...                             errors='xmlcharrefreplace')
>>> print('Jalape\u00f1o')
Jalape&#241;o
>>>

注�下最�输出中的�ASCII字符 ñ 是如何被 &#241; �代的。