Last assistant response is not valid canvas: expected string or bytes-like object
Running on local URL: http://0.0.0.0:7860
To create a public link, set share=True in launch().
You shouldn't move a model that is dispatched using accelerate hooks.
Load to GPU: LlamaForCausalLM
The attention mask and the pad token id were not set. As a consequence, you may observe unexpected behavior. Please pass your input's attention_mask to obtain reliable results.
Setting pad_token_id to eos_token_id:128001 for open-end generation.
Exception in thread Thread-11 (generate):
Traceback (most recent call last):
File "C:\Users\john_\AppData\Local\Programs\Python\Python310\lib\threading.py", line 1016, in bootstrap_inner
self.run()
File "C:\Users\john\AppData\Local\Programs\Python\Python310\lib\threading.py", line 953, in run
self.target(*self.args, **self.kwargs)
File "C:\Users\john\AppData\Local\Programs\Python\Python310\lib\site-packages\torch\\utils_contextlib.py", line 115, in decorate_context
return func(*args, **kwargs)
File "C:\Users\john\AppData\Local\Programs\Python\Python310\lib\site-packages\transformers\generation\\utils.py", line 1758, in generate
result = self.sample(
File "C:\Users\john\AppData\Local\Programs\Python\Python310\lib\site-packages\transformers\generation\\utils.py", line 2397, in sample
outputs = self(
File "C:\Users\john\AppData\Local\Programs\Python\Python310\lib\site-packages\torch\nn\modules\module.py", line 1501, in call_impl
return forward_call(*args, **kwargs)
File "C:\Users\john\AppData\Local\Programs\Python\Python310\lib\site-packages\accelerate\hooks.py", line 166, in new_forward
output = module.old_forward(*args, **kwargs)
File "C:\Users\john\AppData\Local\Programs\Python\Python310\lib\site-packages\transformers\models\llama\modeling_llama.py", line 1164, in forward
outputs = self.model(
File "C:\Users\john\AppData\Local\Programs\Python\Python310\lib\site-packages\torch\nn\modules\module.py", line 1501, in call_impl
return forward_call(*args, **kwargs)
File "C:\Users\john\AppData\Local\Programs\Python\Python310\lib\site-packages\accelerate\hooks.py", line 166, in new_forward
output = module.old_forward(*args, **kwargs)
File "C:\Users\john\AppData\Local\Programs\Python\Python310\lib\site-packages\transformers\models\llama\modeling_llama.py", line 940, in forward
causal_mask = self.update_causal_mask(
File "C:\Users\john\AppData\Local\Programs\Python\Python310\lib\site-packages\transformers\models\llama\modeling_llama.py", line 1061, in update_causal_mask
causal_mask = torch.triu(causal_mask, diagonal=1)
RuntimeError: "triu_tril_cuda_template" not implemented for 'BFloat16'
Traceback (most recent call last):
File "C:\Users\john\AppData\Local\Programs\Python\Python310\lib\site-packages\gradio\queueing.py", line 528, in process_events
response = await route_utils.call_process_api(
File "C:\Users\john_\AppData\Local\Programs\Python\Python310\lib\site-packages\gradio\route_utils.py", line 270, in call_process_api
output = await app.get_blocks().process_api(
File "C:\Users\john_\AppData\Local\Programs\Python\Python310\lib\site-packages\gradio\blocks.py", line 1908, in process_api
result = await self.call_function(
File "C:\Users\john_\AppData\Local\Programs\Python\Python310\lib\site-packages\gradio\blocks.py", line 1497, in call_function
prediction = await utils.async_iteration(iterator)
File "C:\Users\john_\AppData\Local\Programs\Python\Python310\lib\site-packages\gradio\\utils.py", line 632, in async_iteration
return await iterator.anext()
File "C:\Users\john_\AppData\Local\Programs\Python\Python310\lib\site-packages\gradio\\utils.py", line 758, in asyncgen_wrapper
response = await iterator.anext()
File "X:\Omost\chat_interface.py", line 554, in stream_fn
first_response, first_interrupter = await async_iteration(generator)
File "C:\Users\john\AppData\Local\Programs\Python\Python310\lib\site-packages\gradio\\utils.py", line 632, in async_iteration
return await iterator.anext()
File "C:\Users\john_\AppData\Local\Programs\Python\Python310\lib\site-packages\gradio\\utils.py", line 625, in anext
return await anyio.to_thread.run_sync(
File "C:\Users\john_\AppData\Local\Programs\Python\Python310\lib\site-packages\anyio\to_thread.py", line 31, in run_sync
return await get_asynclib().run_sync_in_worker_thread(
File "C:\Users\john_\AppData\Local\Programs\Python\Python310\lib\site-packages\anyio_backends_asyncio.py", line 937, in run_sync_in_worker_thread
return await future
File "C:\Users\john_\AppData\Local\Programs\Python\Python310\lib\site-packages\anyio_backends_asyncio.py", line 867, in run
result = context.run(func, *args)
File "C:\Users\john_\AppData\Local\Programs\Python\Python310\lib\site-packages\gradio\\utils.py", line 608, in run_sync_iterator_async
return next(iterator)
File "C:\Users\john_\AppData\Local\Programs\Python\Python310\lib\site-packages\torch\\utils_contextlib.py", line 35, in generator_context
response = gen.send(None)
File "X:\Omost\gradio_app.py", line 164, in chat_fn
for text in streamer:
File "C:\Users\john_\AppData\Local\Programs\Python\Python310\lib\site-packages\transformers\generation\streamers.py", line 223, in next
value = self.text_queue.get(timeout=self.timeout)
File "C:\Users\john_\AppData\Local\Programs\Python\Python310\lib\queue.py", line 179, in get
raise Empty
queue.Empty
Last assistant response is not valid canvas: expected string or bytes-like object
Traceback (most recent call last):
File "C:\Users\john\AppData\Local\Programs\Python\Python310\lib\site-packages\gradio\queueing.py", line 528, in process_events
response = await route_utils.call_process_api(
File "C:\Users\john_\AppData\Local\Programs\Python\Python310\lib\site-packages\gradio\route_utils.py", line 270, in call_process_api
output = await app.get_blocks().process_api(
File "C:\Users\john_\AppData\Local\Programs\Python\Python310\lib\site-packages\gradio\blocks.py", line 1908, in process_api
result = await self.call_function(
File "C:\Users\john_\AppData\Local\Programs\Python\Python310\lib\site-packages\gradio\blocks.py", line 1497, in call_function
prediction = await utils.async_iteration(iterator)
File "C:\Users\john_\AppData\Local\Programs\Python\Python310\lib\site-packages\gradio\\utils.py", line 632, in async_iteration
return await iterator.anext()
File "C:\Users\john_\AppData\Local\Programs\Python\Python310\lib\site-packages\gradio\\utils.py", line 758, in asyncgen_wrapper
response = await iterator.anext()
File "X:\Omost\chat_interface.py", line 554, in stream_fn
first_response, first_interrupter = await async_iteration(generator)
File "C:\Users\john\AppData\Local\Programs\Python\Python310\lib\site-packages\gradio\\utils.py", line 632, in async_iteration
return await iterator.anext()
File "C:\Users\john_\AppData\Local\Programs\Python\Python310\lib\site-packages\gradio\\utils.py", line 625, in anext
return await anyio.to_thread.run_sync(
File "C:\Users\john_\AppData\Local\Programs\Python\Python310\lib\site-packages\anyio\to_thread.py", line 31, in run_sync
return await get_asynclib().run_sync_in_worker_thread(
File "C:\Users\john_\AppData\Local\Programs\Python\Python310\lib\site-packages\anyio_backends_asyncio.py", line 937, in run_sync_in_worker_thread
return await future
File "C:\Users\john_\AppData\Local\Programs\Python\Python310\lib\site-packages\anyio_backends_asyncio.py", line 867, in run
result = context.run(func, *args)
File "C:\Users\john_\AppData\Local\Programs\Python\Python310\lib\site-packages\gradio\\utils.py", line 608, in run_sync_iterator_async
return next(iterator)
File "C:\Users\john_\AppData\Local\Programs\Python\Python310\lib\site-packages\torch\\utils_contextlib.py", line 35, in generator_context
response = gen.send(None)
File "X:\Omost\gradio_app.py", line 116, in chat_fn
np.random.seed(int(seed))
File "numpy\random\mtrand.pyx", line 4806, in numpy.random.mtrand.seed
File "numpy\random\mtrand.pyx", line 250, in numpy.random.mtrand.RandomState.seed
File "mt19937.pyx", line 168, in numpy.random.mt19937.MT19937.legacy_seeding
File "mt19937.pyx", line 182, in numpy.random.mt19937.MT19937.legacy_seeding
ValueError: Seed must be between 0 and 2**32 - 1
Last assistant response is not valid canvas: expected string or bytes-like object
Traceback (most recent call last):
File "C:\Users\john\AppData\Local\Programs\Python\Python310\lib\site-packages\gradio\queueing.py", line 528, in process_events
response = await route_utils.call_process_api(
File "C:\Users\john\AppData\Local\Programs\Python\Python310\lib\site-packages\gradio\route_utils.py", line 270, in call_process_api
output = await app.get_blocks().process_api(
File "C:\Users\john\AppData\Local\Programs\Python\Python310\lib\site-packages\gradio\blocks.py", line 1908, in process_api
result = await self.call_function(
File "C:\Users\john\AppData\Local\Programs\Python\Python310\lib\site-packages\gradio\blocks.py", line 1497, in call_function
prediction = await utils.async_iteration(iterator)
File "C:\Users\john\AppData\Local\Programs\Python\Python310\lib\site-packages\gradio\\utils.py", line 632, in async_iteration
return await iterator.anext()
File "C:\Users\john\AppData\Local\Programs\Python\Python310\lib\site-packages\gradio\\utils.py", line 758, in asyncgen_wrapper
response = await iterator.anext()
File "X:\Omost\chat_interface.py", line 554, in stream_fn
first_response, first_interrupter = await async_iteration(generator)
File "C:\Users\john\AppData\Local\Programs\Python\Python310\lib\site-packages\gradio\\utils.py", line 632, in async_iteration
return await iterator.anext()
File "C:\Users\john_\AppData\Local\Programs\Python\Python310\lib\site-packages\gradio\\utils.py", line 625, in anext
return await anyio.to_thread.run_sync(
File "C:\Users\john_\AppData\Local\Programs\Python\Python310\lib\site-packages\anyio\to_thread.py", line 31, in run_sync
return await get_asynclib().run_sync_in_worker_thread(
File "C:\Users\john_\AppData\Local\Programs\Python\Python310\lib\site-packages\anyio_backends_asyncio.py", line 937, in run_sync_in_worker_thread
return await future
File "C:\Users\john_\AppData\Local\Programs\Python\Python310\lib\site-packages\anyio_backends_asyncio.py", line 867, in run
result = context.run(func, *args)
File "C:\Users\john_\AppData\Local\Programs\Python\Python310\lib\site-packages\gradio\\utils.py", line 608, in run_sync_iterator_async
return next(iterator)
File "C:\Users\john_\AppData\Local\Programs\Python\Python310\lib\site-packages\torch\\utils_contextlib.py", line 35, in generator_context
response = gen.send(None)
File "X:\Omost\gradio_app.py", line 116, in chat_fn
np.random.seed(int(seed))
File "numpy\random\mtrand.pyx", line 4806, in numpy.random.mtrand.seed
File "numpy\random\mtrand.pyx", line 250, in numpy.random.mtrand.RandomState.seed
File "mt19937.pyx", line 168, in numpy.random.mt19937.MT19937.legacy_seeding
File "mt19937.pyx", line 182, in numpy.random.mt19937.MT19937.legacy_seeding
ValueError: Seed must be between 0 and 2**32 - 1
Last assistant response is not valid canvas: expected string or bytes-like object
The attention mask and the pad token id were not set. As a consequence, you may observe unexpected behavior. Please pass your input's attention_mask to obtain reliable results.
Setting pad_token_id to eos_token_id:128001 for open-end generation.
Exception in thread Thread-12 (generate):
Traceback (most recent call last):
File "C:\Users\john\AppData\Local\Programs\Python\Python310\lib\threading.py", line 1016, in bootstrap_inner
self.run()
File "C:\Users\john\AppData\Local\Programs\Python\Python310\lib\threading.py", line 953, in run
self.target(*self.args, **self.kwargs)
File "C:\Users\john\AppData\Local\Programs\Python\Python310\lib\site-packages\torch\\utils_contextlib.py", line 115, in decorate_context
return func(*args, **kwargs)
File "C:\Users\john\AppData\Local\Programs\Python\Python310\lib\site-packages\transformers\generation\\utils.py", line 1758, in generate
result = self.sample(
File "C:\Users\john\AppData\Local\Programs\Python\Python310\lib\site-packages\transformers\generation\\utils.py", line 2397, in sample
outputs = self(
File "C:\Users\john\AppData\Local\Programs\Python\Python310\lib\site-packages\torch\nn\modules\module.py", line 1501, in call_impl
return forward_call(*args, **kwargs)
File "C:\Users\john\AppData\Local\Programs\Python\Python310\lib\site-packages\accelerate\hooks.py", line 166, in new_forward
output = module.old_forward(*args, **kwargs)
File "C:\Users\john\AppData\Local\Programs\Python\Python310\lib\site-packages\transformers\models\llama\modeling_llama.py", line 1164, in forward
outputs = self.model(
File "C:\Users\john\AppData\Local\Programs\Python\Python310\lib\site-packages\torch\nn\modules\module.py", line 1501, in call_impl
return forward_call(*args, **kwargs)
File "C:\Users\john\AppData\Local\Programs\Python\Python310\lib\site-packages\accelerate\hooks.py", line 166, in new_forward
output = module.old_forward(*args, **kwargs)
File "C:\Users\john\AppData\Local\Programs\Python\Python310\lib\site-packages\transformers\models\llama\modeling_llama.py", line 940, in forward
causal_mask = self.update_causal_mask(
File "C:\Users\john\AppData\Local\Programs\Python\Python310\lib\site-packages\transformers\models\llama\modeling_llama.py", line 1061, in update_causal_mask
causal_mask = torch.triu(causal_mask, diagonal=1)
RuntimeError: "triu_tril_cuda_template" not implemented for 'BFloat16'
Traceback (most recent call last):
File "C:\Users\john\AppData\Local\Programs\Python\Python310\lib\site-packages\gradio\queueing.py", line 528, in process_events
response = await route_utils.call_process_api(
File "C:\Users\john\AppData\Local\Programs\Python\Python310\lib\site-packages\gradio\route_utils.py", line 270, in call_process_api
output = await app.get_blocks().process_api(
File "C:\Users\john\AppData\Local\Programs\Python\Python310\lib\site-packages\gradio\blocks.py", line 1908, in process_api
result = await self.call_function(
File "C:\Users\john\AppData\Local\Programs\Python\Python310\lib\site-packages\gradio\blocks.py", line 1497, in call_function
prediction = await utils.async_iteration(iterator)
File "C:\Users\john\AppData\Local\Programs\Python\Python310\lib\site-packages\gradio\\utils.py", line 632, in async_iteration
return await iterator.anext()
File "C:\Users\john\AppData\Local\Programs\Python\Python310\lib\site-packages\gradio\\utils.py", line 758, in asyncgen_wrapper
response = await iterator.anext()
File "X:\Omost\chat_interface.py", line 554, in stream_fn
first_response, first_interrupter = await async_iteration(generator)
File "C:\Users\john\AppData\Local\Programs\Python\Python310\lib\site-packages\gradio\\utils.py", line 632, in async_iteration
return await iterator.anext()
File "C:\Users\john_\AppData\Local\Programs\Python\Python310\lib\site-packages\gradio\\utils.py", line 625, in anext
return await anyio.to_thread.run_sync(
File "C:\Users\john_\AppData\Local\Programs\Python\Python310\lib\site-packages\anyio\to_thread.py", line 31, in run_sync
return await get_asynclib().run_sync_in_worker_thread(
File "C:\Users\john_\AppData\Local\Programs\Python\Python310\lib\site-packages\anyio_backends_asyncio.py", line 937, in run_sync_in_worker_thread
return await future
File "C:\Users\john_\AppData\Local\Programs\Python\Python310\lib\site-packages\anyio_backends_asyncio.py", line 867, in run
result = context.run(func, *args)
File "C:\Users\john_\AppData\Local\Programs\Python\Python310\lib\site-packages\gradio\\utils.py", line 608, in run_sync_iterator_async
return next(iterator)
File "C:\Users\john_\AppData\Local\Programs\Python\Python310\lib\site-packages\torch\\utils_contextlib.py", line 35, in generator_context
response = gen.send(None)
File "X:\Omost\gradio_app.py", line 164, in chat_fn
for text in streamer:
File "C:\Users\john_\AppData\Local\Programs\Python\Python310\lib\site-packages\transformers\generation\streamers.py", line 223, in next
value = self.text_queue.get(timeout=self.timeout)
File "C:\Users\john_\AppData\Local\Programs\Python\Python310\lib\queue.py", line 179, in get
raise Empty
queue.Empty
Last assistant response is not valid canvas: expected string or bytes-like object
The attention mask and the pad token id were not set. As a consequence, you may observe unexpected behavior. Please pass your input's attention_mask to obtain reliable results.
Setting pad_token_id to eos_token_id:128001 for open-end generation.
Exception in thread Thread-13 (generate):
Traceback (most recent call last):
File "C:\Users\john\AppData\Local\Programs\Python\Python310\lib\threading.py", line 1016, in bootstrap_inner
self.run()
File "C:\Users\john\AppData\Local\Programs\Python\Python310\lib\threading.py", line 953, in run
self.target(*self.args, **self.kwargs)
File "C:\Users\john\AppData\Local\Programs\Python\Python310\lib\site-packages\torch\\utils_contextlib.py", line 115, in decorate_context
return func(*args, **kwargs)
File "C:\Users\john\AppData\Local\Programs\Python\Python310\lib\site-packages\transformers\generation\\utils.py", line 1758, in generate
result = self.sample(
File "C:\Users\john\AppData\Local\Programs\Python\Python310\lib\site-packages\transformers\generation\\utils.py", line 2397, in sample
outputs = self(
File "C:\Users\john\AppData\Local\Programs\Python\Python310\lib\site-packages\torch\nn\modules\module.py", line 1501, in call_impl
return forward_call(*args, **kwargs)
File "C:\Users\john\AppData\Local\Programs\Python\Python310\lib\site-packages\accelerate\hooks.py", line 166, in new_forward
output = module.old_forward(*args, **kwargs)
File "C:\Users\john\AppData\Local\Programs\Python\Python310\lib\site-packages\transformers\models\llama\modeling_llama.py", line 1164, in forward
outputs = self.model(
File "C:\Users\john\AppData\Local\Programs\Python\Python310\lib\site-packages\torch\nn\modules\module.py", line 1501, in call_impl
return forward_call(*args, **kwargs)
File "C:\Users\john\AppData\Local\Programs\Python\Python310\lib\site-packages\accelerate\hooks.py", line 166, in new_forward
output = module.old_forward(*args, **kwargs)
File "C:\Users\john\AppData\Local\Programs\Python\Python310\lib\site-packages\transformers\models\llama\modeling_llama.py", line 940, in forward
causal_mask = self.update_causal_mask(
File "C:\Users\john\AppData\Local\Programs\Python\Python310\lib\site-packages\transformers\models\llama\modeling_llama.py", line 1061, in update_causal_mask
causal_mask = torch.triu(causal_mask, diagonal=1)
RuntimeError: "triu_tril_cuda_template" not implemented for 'BFloat16'
Traceback (most recent call last):
File "C:\Users\john\AppData\Local\Programs\Python\Python310\lib\site-packages\gradio\queueing.py", line 528, in process_events
response = await route_utils.call_process_api(
File "C:\Users\john_\AppData\Local\Programs\Python\Python310\lib\site-packages\gradio\route_utils.py", line 270, in call_process_api
output = await app.get_blocks().process_api(
File "C:\Users\john_\AppData\Local\Programs\Python\Python310\lib\site-p
Source: lllyasviel/Omost