Respan Dataset Explorer
Select one behavior. Every returned turn has one binary label: Present or Absent. Source: final dense boolean release.
5,167,182physical rows
86shards
0.00%qualified row coverage
0.00%qualified cell coverage
turns-00075.parquet:30143
90bda04cdea506303e34253c
turn 1/1gpt-4.1-mini-2025-04-14VietnameseThe Netherlands290 words
degenerate_repetitionAbsentFinal dense release
USER
Bạn là một mô hình thẩm phán (judge) trong một hệ thống chấm điểm khả năng gọi hàm (function calling) của một mô hình nhỏ hơn.
Bạn sẽ nhận một câu hỏi người dùng, một danh sách các hàm có sẵn, và đầu ra của mô hình.
Nhiệm vụ của bạn là đánh giá liệu mô hình nhỏ hơn có thể tạo ra các lời gọi hàm chính xác không,
đồng thời cung cấp một điểm số dựa trên tính chính xác và đầy đủ của câu trả lời.
Câu hỏi người dùng:
Create a mix track using notes of C major scale and duration of each note being quarter of a second with a duration of 3 minutes.
Danh sách các hàm có sẵn:
[{"name": "music_composer.create_mix", "description": "Create a mix of a song based on a particular music scale and duration", "parameters": {"type": "object", "properties": {"scale": {"type": "string", "description": "The musical scale to be used. E.g: C Major, A Minor, etc."}, "note_duration": {"type": "string", "description": "Duration of each note. Options: 'whole', 'half', 'quarter', 'eighth', 'sixteenth'.", "enum": ["whole", "half", "quarter", "eighth", "sixteenth"]}, "track_length": {"type": "integer", "description": "Length of the mix track in seconds."}}, "required": ["scale", "note_duration", "track_length"]}}]
Đầu ra của mô hình nhỏ hơn:
<tool_call>
{"name": "music_composer.create_mix", "arguments": {"scale": "C Major", "note_duration": "quarter", "track_length": 180}}
</tool_call>
Đánh giá đầu ra dựa trên các tiêu chí sau:
1. Chính xác (0-10 điểm)
2. Thứ tự gọi hàm (0-10 điểm)
Lưu ý: Nếu không có hàm nào phù hợp, mô hình có thể từ chối gọi hàm và vẫn được tính điểm chính xác.
Chỉ trả về JSON theo định dạng:
{
"correct": <điểm chính xác>,
"function_order": <điểm thứ tự>,
"total_score": <tổng điểm>
}ASSISTANT
{
"correct": 10,
"function_order": 10,
"total_score": 20
}
turns-00075.parquet:30144
3094fb9dac1b6c92b6dab818
turn 1/1gpt-4.1-mini-2025-04-14VietnameseThe Netherlands257 words
degenerate_repetitionAbsentFinal dense release
USER
Bạn là một mô hình thẩm phán (judge) trong một hệ thống chấm điểm khả năng gọi hàm (function calling) của một mô hình nhỏ hơn.
Bạn sẽ nhận một câu hỏi người dùng, một danh sách các hàm có sẵn, và đầu ra của mô hình.
Nhiệm vụ của bạn là đánh giá liệu mô hình nhỏ hơn có thể tạo ra các lời gọi hàm chính xác không,
đồng thời cung cấp một điểm số dựa trên tính chính xác và đầy đủ của câu trả lời.
Câu hỏi người dùng:
Generate a major chord progression in C key with four chords.
Danh sách các hàm có sẵn:
[{"name": "music_generation.create_chord_progression", "description": "Create a chord progression in a specific key and number of chords.", "parameters": {"type": "object", "properties": {"key": {"type": "string", "description": "The key for the chord progression."}, "chords": {"type": "integer", "description": "Number of chords in the progression."}, "progression_type": {"type": "string", "description": "The type of the chord progression. Optional parameter. Default is 'major'."}}, "required": ["key", "chords"]}}]
Đầu ra của mô hình nhỏ hơn:
```
[{'name': 'music_generation.create_chord_progression', 'arguments': {'key': 'C', 'chords': 4}}]
```
Đánh giá đầu ra dựa trên các tiêu chí sau:
1. Chính xác (0-10 điểm)
2. Thứ tự gọi hàm (0-10 điểm)
Lưu ý: Nếu không có hàm nào phù hợp, mô hình có thể từ chối gọi hàm và vẫn được tính điểm chính xác.
Chỉ trả về JSON theo định dạng:
{
"correct": <điểm chính xác>,
"function_order": <điểm thứ tự>,
"total_score": <tổng điểm>
}ASSISTANT
{
"correct": 10,
"function_order": 10,
"total_score": 20
}
turns-00075.parquet:30145
2a6249fbf3c0469006f02071
turn 1/1gpt-4.1-mini-2025-04-14VietnameseThe Netherlands259 words
degenerate_repetitionAbsentFinal dense release
USER
Bạn là một mô hình thẩm phán (judge) trong một hệ thống chấm điểm khả năng gọi hàm (function calling) của một mô hình nhỏ hơn.
Bạn sẽ nhận một câu hỏi người dùng, một danh sách các hàm có sẵn, và đầu ra của mô hình.
Nhiệm vụ của bạn là đánh giá liệu mô hình nhỏ hơn có thể tạo ra các lời gọi hàm chính xác không,
đồng thời cung cấp một điểm số dựa trên tính chính xác và đầy đủ của câu trả lời.
Câu hỏi người dùng:
Generate a major chord progression in C key with four chords.
Danh sách các hàm có sẵn:
[{"name": "music_generation.create_chord_progression", "description": "Create a chord progression in a specific key and number of chords.", "parameters": {"type": "object", "properties": {"key": {"type": "string", "description": "The key for the chord progression."}, "chords": {"type": "integer", "description": "Number of chords in the progression."}, "progression_type": {"type": "string", "description": "The type of the chord progression. Optional parameter. Default is 'major'."}}, "required": ["key", "chords"]}}]
Đầu ra của mô hình nhỏ hơn:
<tool_call>
{"name": "music_generation.create_chord_progression", "arguments": {"key": "C", "chords": 4, "progression_type": "major"}}
</tool_call>
Đánh giá đầu ra dựa trên các tiêu chí sau:
1. Chính xác (0-10 điểm)
2. Thứ tự gọi hàm (0-10 điểm)
Lưu ý: Nếu không có hàm nào phù hợp, mô hình có thể từ chối gọi hàm và vẫn được tính điểm chính xác.
Chỉ trả về JSON theo định dạng:
{
"correct": <điểm chính xác>,
"function_order": <điểm thứ tự>,
"total_score": <tổng điểm>
}ASSISTANT
{
"correct": 10,
"function_order": 10,
"total_score": 20
}
turns-00075.parquet:30146
91d710596f2ff3ce793be892
turn 1/1gpt-4.1-mini-2025-04-14VietnameseThe Netherlands264 words
degenerate_repetitionAbsentFinal dense release
USER
Bạn là một mô hình thẩm phán (judge) trong một hệ thống chấm điểm khả năng gọi hàm (function calling) của một mô hình nhỏ hơn.
Bạn sẽ nhận một câu hỏi người dùng, một danh sách các hàm có sẵn, và đầu ra của mô hình.
Nhiệm vụ của bạn là đánh giá liệu mô hình nhỏ hơn có thể tạo ra các lời gọi hàm chính xác không,
đồng thời cung cấp một điểm số dựa trên tính chính xác và đầy đủ của câu trả lời.
Câu hỏi người dùng:
Find the lyrics to the song 'Bohemian Rhapsody' by Queen.
Danh sách các hàm có sẵn:
[{"name": "get_song_lyrics", "description": "Retrieve the lyrics of a song based on the artist's name and song title.", "parameters": {"type": "object", "properties": {"song_title": {"type": "string", "description": "The title of the song."}, "artist_name": {"type": "string", "description": "The name of the artist who performed the song."}, "lang": {"type": "string", "description": "The language of the lyrics. Default is English.", "enum": ["English", "French", "Spanish", "German", "Italian"]}}, "required": ["song_title", "artist_name"]}}]
Đầu ra của mô hình nhỏ hơn:
```
[{'name': 'get_song_lyrics', 'arguments': {'song_title': 'Bohemian Rhapsody', 'artist_name': 'Queen'}}]
```
Đánh giá đầu ra dựa trên các tiêu chí sau:
1. Chính xác (0-10 điểm)
2. Thứ tự gọi hàm (0-10 điểm)
Lưu ý: Nếu không có hàm nào phù hợp, mô hình có thể từ chối gọi hàm và vẫn được tính điểm chính xác.
Chỉ trả về JSON theo định dạng:
{
"correct": <điểm chính xác>,
"function_order": <điểm thứ tự>,
"total_score": <tổng điểm>
}ASSISTANT
{
"correct": 10,
"function_order": 10,
"total_score": 20
}
turns-00075.parquet:30147
52a326eb326e5ecbbb6401cf
turn 1/1gpt-4.1-mini-2025-04-14VietnameseThe Netherlands264 words
degenerate_repetitionAbsentFinal dense release
USER
Bạn là một mô hình thẩm phán (judge) trong một hệ thống chấm điểm khả năng gọi hàm (function calling) của một mô hình nhỏ hơn.
Bạn sẽ nhận một câu hỏi người dùng, một danh sách các hàm có sẵn, và đầu ra của mô hình.
Nhiệm vụ của bạn là đánh giá liệu mô hình nhỏ hơn có thể tạo ra các lời gọi hàm chính xác không,
đồng thời cung cấp một điểm số dựa trên tính chính xác và đầy đủ của câu trả lời.
Câu hỏi người dùng:
Find the lyrics to the song 'Bohemian Rhapsody' by Queen.
Danh sách các hàm có sẵn:
[{"name": "get_song_lyrics", "description": "Retrieve the lyrics of a song based on the artist's name and song title.", "parameters": {"type": "object", "properties": {"song_title": {"type": "string", "description": "The title of the song."}, "artist_name": {"type": "string", "description": "The name of the artist who performed the song."}, "lang": {"type": "string", "description": "The language of the lyrics. Default is English.", "enum": ["English", "French", "Spanish", "German", "Italian"]}}, "required": ["song_title", "artist_name"]}}]
Đầu ra của mô hình nhỏ hơn:
<tool_call>
{"name": "get_song_lyrics", "arguments": {"song_title": "Bohemian Rhapsody", "artist_name": "Queen"}}
</tool_call>
Đánh giá đầu ra dựa trên các tiêu chí sau:
1. Chính xác (0-10 điểm)
2. Thứ tự gọi hàm (0-10 điểm)
Lưu ý: Nếu không có hàm nào phù hợp, mô hình có thể từ chối gọi hàm và vẫn được tính điểm chính xác.
Chỉ trả về JSON theo định dạng:
{
"correct": <điểm chính xác>,
"function_order": <điểm thứ tự>,
"total_score": <tổng điểm>
}ASSISTANT
{
"correct": 10,
"function_order": 10,
"total_score": 20
}
turns-00075.parquet:30148
9dc48bd23eed385be9ea6bff
turn 1/1gpt-4.1-mini-2025-04-14VietnameseThe Netherlands284 words
degenerate_repetitionAbsentFinal dense release
USER
Bạn là một mô hình thẩm phán (judge) trong một hệ thống chấm điểm khả năng gọi hàm (function calling) của một mô hình nhỏ hơn.
Bạn sẽ nhận một câu hỏi người dùng, một danh sách các hàm có sẵn, và đầu ra của mô hình.
Nhiệm vụ của bạn là đánh giá liệu mô hình nhỏ hơn có thể tạo ra các lời gọi hàm chính xác không,
đồng thời cung cấp một điểm số dựa trên tính chính xác và đầy đủ của câu trả lời.
Câu hỏi người dùng:
Generate a major C scale progression with tempo 80 BPM and duration 4 beats.
Danh sách các hàm có sẵn:
[{"name": "music_generator.generate_scale_progression", "description": "Generate a music scale progression in a specific key with a given tempo and duration.", "parameters": {"type": "object", "properties": {"key": {"type": "string", "description": "The key in which to generate the scale progression."}, "tempo": {"type": "integer", "description": "The tempo of the scale progression in BPM."}, "duration": {"type": "integer", "description": "The duration of each note in beats."}, "scale_type": {"type": "string", "default": "major", "description": "The type of scale to generate. Defaults to 'major'."}}, "required": ["key", "tempo", "duration"]}}]
Đầu ra của mô hình nhỏ hơn:
```
[{"name": "music_generator.generate_scale_progression", "arguments": {"key": "C", "tempo": 80, "duration": 4, "scale_type": "major"}}]
```
Đánh giá đầu ra dựa trên các tiêu chí sau:
1. Chính xác (0-10 điểm)
2. Thứ tự gọi hàm (0-10 điểm)
Lưu ý: Nếu không có hàm nào phù hợp, mô hình có thể từ chối gọi hàm và vẫn được tính điểm chính xác.
Chỉ trả về JSON theo định dạng:
{
"correct": <điểm chính xác>,
"function_order": <điểm thứ tự>,
"total_score": <tổng điểm>
}ASSISTANT
{
"correct": 10,
"function_order": 10,
"total_score": 20
}
turns-00075.parquet:30149
74d415174196e639b4e378d8
turn 1/1gpt-4.1-mini-2025-04-14VietnameseThe Netherlands284 words
degenerate_repetitionAbsentFinal dense release
USER
Bạn là một mô hình thẩm phán (judge) trong một hệ thống chấm điểm khả năng gọi hàm (function calling) của một mô hình nhỏ hơn.
Bạn sẽ nhận một câu hỏi người dùng, một danh sách các hàm có sẵn, và đầu ra của mô hình.
Nhiệm vụ của bạn là đánh giá liệu mô hình nhỏ hơn có thể tạo ra các lời gọi hàm chính xác không,
đồng thời cung cấp một điểm số dựa trên tính chính xác và đầy đủ của câu trả lời.
Câu hỏi người dùng:
Generate a major C scale progression with tempo 80 BPM and duration 4 beats.
Danh sách các hàm có sẵn:
[{"name": "music_generator.generate_scale_progression", "description": "Generate a music scale progression in a specific key with a given tempo and duration.", "parameters": {"type": "object", "properties": {"key": {"type": "string", "description": "The key in which to generate the scale progression."}, "tempo": {"type": "integer", "description": "The tempo of the scale progression in BPM."}, "duration": {"type": "integer", "description": "The duration of each note in beats."}, "scale_type": {"type": "string", "default": "major", "description": "The type of scale to generate. Defaults to 'major'."}}, "required": ["key", "tempo", "duration"]}}]
Đầu ra của mô hình nhỏ hơn:
<tool_call>
{"name": "music_generator.generate_scale_progression", "arguments": {"key": "C", "tempo": 80, "duration": 4, "scale_type": "major"}}
</tool_call>
Đánh giá đầu ra dựa trên các tiêu chí sau:
1. Chính xác (0-10 điểm)
2. Thứ tự gọi hàm (0-10 điểm)
Lưu ý: Nếu không có hàm nào phù hợp, mô hình có thể từ chối gọi hàm và vẫn được tính điểm chính xác.
Chỉ trả về JSON theo định dạng:
{
"correct": <điểm chính xác>,
"function_order": <điểm thứ tự>,
"total_score": <tổng điểm>
}ASSISTANT
{
"correct": 10,
"function_order": 10,
"total_score": 20
}
turns-00075.parquet:30150
65e3884def83ccec12056bd1
turn 1/1gpt-4.1-mini-2025-04-14VietnameseThe Netherlands299 words
degenerate_repetitionAbsentFinal dense release
USER
Bạn là một mô hình thẩm phán (judge) trong một hệ thống chấm điểm khả năng gọi hàm (function calling) của một mô hình nhỏ hơn.
Bạn sẽ nhận một câu hỏi người dùng, một danh sách các hàm có sẵn, và đầu ra của mô hình.
Nhiệm vụ của bạn là đánh giá liệu mô hình nhỏ hơn có thể tạo ra các lời gọi hàm chính xác không,
đồng thời cung cấp một điểm số dựa trên tính chính xác và đầy đủ của câu trả lời.
Câu hỏi người dùng:
music.theory.chordProgression(progression=['I', 'V', 'vi', 'IV'])
Danh sách các hàm có sẵn:
[{"name": "music.theory.chordProgression", "description": "Identifies a potential key signature for the given chord progression.", "parameters": {"type": "object", "properties": {"progression": {"type": "array", "items": {"type": "string"}, "description": "The chord progression in Roman numerals. Eg: ['I', 'V', 'vi', 'IV']."}, "returnAllPossibleKeys": {"type": "boolean", "description": "Flag indicating if the function should return all possible key signatures that fit the chord progression. If false, the function will return the first valid key it finds. Default is false."}, "assumeMajor": {"type": "boolean", "description": "Assumption if the key signature is Major. If true, the function will assume the key signature to be major and otherwise minor. Default is true."}}, "required": ["progression"]}}]
Đầu ra của mô hình nhỏ hơn:
```
[{'name': 'music.theory.chordProgression', 'arguments': {'progression': ['I', 'V', 'vi', 'IV'], 'returnAllPossibleKeys': false, 'assumeMajor': true}}]
```
Đánh giá đầu ra dựa trên các tiêu chí sau:
1. Chính xác (0-10 điểm)
2. Thứ tự gọi hàm (0-10 điểm)
Lưu ý: Nếu không có hàm nào phù hợp, mô hình có thể từ chối gọi hàm và vẫn được tính điểm chính xác.
Chỉ trả về JSON theo định dạng:
{
"correct": <điểm chính xác>,
"function_order": <điểm thứ tự>,
"total_score": <tổng điểm>
}ASSISTANT
{
"correct": 10,
"function_order": 10,
"total_score": 20
}
turns-00075.parquet:30151
0b66c0c1ce18a94bbad82458
turn 1/1gpt-4.1-mini-2025-04-14VietnameseThe Netherlands299 words
degenerate_repetitionAbsentFinal dense release
USER
Bạn là một mô hình thẩm phán (judge) trong một hệ thống chấm điểm khả năng gọi hàm (function calling) của một mô hình nhỏ hơn.
Bạn sẽ nhận một câu hỏi người dùng, một danh sách các hàm có sẵn, và đầu ra của mô hình.
Nhiệm vụ của bạn là đánh giá liệu mô hình nhỏ hơn có thể tạo ra các lời gọi hàm chính xác không,
đồng thời cung cấp một điểm số dựa trên tính chính xác và đầy đủ của câu trả lời.
Câu hỏi người dùng:
music.theory.chordProgression(progression=['I', 'V', 'vi', 'IV'])
Danh sách các hàm có sẵn:
[{"name": "music.theory.chordProgression", "description": "Identifies a potential key signature for the given chord progression.", "parameters": {"type": "object", "properties": {"progression": {"type": "array", "items": {"type": "string"}, "description": "The chord progression in Roman numerals. Eg: ['I', 'V', 'vi', 'IV']."}, "returnAllPossibleKeys": {"type": "boolean", "description": "Flag indicating if the function should return all possible key signatures that fit the chord progression. If false, the function will return the first valid key it finds. Default is false."}, "assumeMajor": {"type": "boolean", "description": "Assumption if the key signature is Major. If true, the function will assume the key signature to be major and otherwise minor. Default is true."}}, "required": ["progression"]}}]
Đầu ra của mô hình nhỏ hơn:
<tool_call>
{"name": "music.theory.chordProgression", "arguments": {"progression": ["I", "V", "vi", "IV"], "returnAllPossibleKeys": false, "assumeMajor": true}}
</tool_call>
Đánh giá đầu ra dựa trên các tiêu chí sau:
1. Chính xác (0-10 điểm)
2. Thứ tự gọi hàm (0-10 điểm)
Lưu ý: Nếu không có hàm nào phù hợp, mô hình có thể từ chối gọi hàm và vẫn được tính điểm chính xác.
Chỉ trả về JSON theo định dạng:
{
"correct": <điểm chính xác>,
"function_order": <điểm thứ tự>,
"total_score": <tổng điểm>
}ASSISTANT
{
"correct": 10,
"function_order": 10,
"total_score": 20
}
turns-00075.parquet:30152
c8e4327974d3f1bd21611e51
turn 1/1gpt-4.1-mini-2025-04-14VietnameseThe Netherlands246 words
degenerate_repetitionAbsentFinal dense release
USER
Bạn là một mô hình thẩm phán (judge) trong một hệ thống chấm điểm khả năng gọi hàm (function calling) của một mô hình nhỏ hơn.
Bạn sẽ nhận một câu hỏi người dùng, một danh sách các hàm có sẵn, và đầu ra của mô hình.
Nhiệm vụ của bạn là đánh giá liệu mô hình nhỏ hơn có thể tạo ra các lời gọi hàm chính xác không,
đồng thời cung cấp một điểm số dựa trên tính chính xác và đầy đủ của câu trả lời.
Câu hỏi người dùng:
What key signature does C# major have?
Danh sách các hàm có sẵn:
[{"name": "music_theory.key_signature", "description": "Return the key signature of a major or minor scale.", "parameters": {"type": "object", "properties": {"key": {"type": "string", "description": "The root of the scale, e.g., 'C', 'F#', 'Ab'."}, "scale_type": {"type": "string", "enum": ["major", "minor"], "description": "Type of the scale, either 'major' or 'minor'. Default is 'major'."}}, "required": ["key"]}}]
Đầu ra của mô hình nhỏ hơn:
```
[{'name': 'music_theory.key_signature', 'arguments': {'key': 'C#', 'scale_type': 'major'}}]
```
Đánh giá đầu ra dựa trên các tiêu chí sau:
1. Chính xác (0-10 điểm)
2. Thứ tự gọi hàm (0-10 điểm)
Lưu ý: Nếu không có hàm nào phù hợp, mô hình có thể từ chối gọi hàm và vẫn được tính điểm chính xác.
Chỉ trả về JSON theo định dạng:
{
"correct": <điểm chính xác>,
"function_order": <điểm thứ tự>,
"total_score": <tổng điểm>
}ASSISTANT
{
"correct": 10,
"function_order": 10,
"total_score": 20
}