5.9 读�二进制数�到��缓冲区中¶

问题¶

你想直接读�二进制数�到一个��缓冲区中,而�需��任何的中间�制�作。 或者你想原地修改数�并将它写回到一个文件中去。

解决方案¶

为了读�数�到一个��数组中,使用文件对象的 readinto() 方法。比如:

import os.path

def read_into_buffer(filename):
    buf = bytearray(os.path.getsize(filename))
    with open(filename, 'rb') as f:
        f.readinto(buf)
    return buf

下�是一个演示这个函数使用方法的例�:

>>> # Write a sample file
>>> with open('sample.bin', 'wb') as f:
...     f.write(b'Hello World')
...
>>> buf = read_into_buffer('sample.bin')
>>> buf
bytearray(b'Hello World')
>>> buf[0:5] = b'Hello'
>>> buf
bytearray(b'Hello World')
>>> with open('newsample.bin', 'wb') as f:
...     f.write(buf)
...
11
>>>

讨论¶

文件对象的 readinto() 方法能被用�为预先分�内存的数组填充数�,甚至包括由 array 模�或 numpy 库创建的数组。 和普通 read() 方法��的是, readinto() 填充已存在的缓冲区而�是为新对象�新分�内存�返回它们。 因此,你�以使用它���大�的内存分��作。 比如,如果你读�一个由相�大�的记录组�的二进制文件时,你�以�下�这样写:

record_size = 32 # Size of each record (adjust value)

buf = bytearray(record_size)
with open('somefile', 'rb') as f:
    while True:
        n = f.readinto(buf)
        if n < record_size:
            break
        # Use the contents of buf
        ...

�外有一个有趣特性就是 memoryview , 它�以通过零�制的方�对已存在的缓冲区执行切片�作,甚至还能修改它的内容。比如:

>>> buf
bytearray(b'Hello World')
>>> m1 = memoryview(buf)
>>> m2 = m1[-5:]
>>> m2
<memory at 0x100681390>
>>> m2[:] = b'WORLD'
>>> buf
bytearray(b'Hello WORLD')
>>>

使用 f.readinto() 时需�注�的是,你必须检查它的返回值,也就是实际读�的字节数。

如果字节数�于缓冲区大�,表明数�被截断或者被破�了(比如你期望�次读�指定数�的字节)。

最�,留心观察其他函数库和模�中和 into 相关的函数(比如 recv_into() , pack_into() 等)。 Python的很多其他部分已�能支�直接的I/O或数�访问�作,这些�作�被用�填充或修改数组和缓冲区内容。

关于解�二进制结构和 memoryviews 使用方法的更高级例�,请�考6.12�节。