thieumao

Kinh Mat

Apr 2nd, 2017
188
0
Never
Not a member of Pastebin yet? Sign Up, it unlocks many cool features!
text 8.76 KB | None | 0 0
  1. hôm qua e có nch vs sư phụ
  2. Trần Nguyễn Duy Tuấn
  3. Tuấn
  4. a nghĩ sao về mắt kính cho ngươì khiếm thị
  5.  
  6. cần cụ thể hơn
  7. vì nếu là mắt kính hoàn thiện, hoặc thay mắt như 1 số nơi cũng nghiên cứu và làm thì nó đòi hỏi rất nhiều
  8. nói chung là anh chưa rõ idea cụ thể em là gì
  9. scope thế nào
  10. nó là dạng camera phân tích rồi nói lại cho người ta
  11. mắt kính có gắn mini camera và 1 cái tai nghe
  12. về phần xử lý :
  13. Nếu là người : phân tích tuổi, emotion , male or gemale...
  14. Nếu là vật : mô tả vật, hình dáng, nó là vật gì, công dụng ...
  15. Nếu là cảnh vật : phân tích cảnh vật, gồm có những gì trong cảnh vật đó
  16. Khoảng cách : ước chừng khoảng cách từ người đến vật
  17. Chữ : text to speech
  18.  
  19. tính làm trong bao lâu
  20. hiện tại microsoft vs google có loại API để xử lý các tác vụ này, chỉ là nó rời rạc và not free
  21. thời gian e chưa rõ vì nó còn nhiều stack khác với idea e còn chưa được duyệt :v
  22.  
  23. anh mà là bgk thì loại ngay
  24. sao thế a
  25.  
  26. đơn giản là cái scope nó quá rộng
  27. vậy theo a thì scope như nào là vừa :v
  28.  
  29. làm sao nhìn vào đó chỉ có 2-3 bài toán cần giải quyết thôi, hoặc thậm chí chỉ có 1, nhưng ứng dụng thì thể nào cũng vài
  30. độ phức tạp của 1 bài toán nhỏ nữa, chỉ ra 1 bài toán bắt đầu cho những bài toán phía sau (xác định giới tính, cảm xúc, ....)
  31. thì trong 1 frame ảnh, có bao nhiêu entities trong đó , làm sao chọn được đúng thứ cần để phân tích
  32. trả lời ý 1 thì cả tỷ thứ, người, bàn ghế, viết,.... rồi trong người thì có mắt, mũi, miệng ....
  33. ....
  34. đấy nội việc làm sao để xử lý hình ảnh đó thôi đã là 1 thứ khổng lồ rồi
  35. nó hoàn toàn khác biệt với việc chú train 1 cái neuron network cho xác định chữ cái, hay đó là con chó con mèo
  36. chỉ riêng việc xác định đó là con chó hay con mèo google cũng tốn ko biết bao nhiêu tg công sức (ko nói state hiện tại)
  37. e có thử tải cái ảnh của a về để test thử cái module e dùng
  38. a năm nay nhiêu tuổi nhỉ :v
  39.  
  40. 28
  41. xê xích 3 tuổi
  42. Faces [ { "age": 31, "gender": "Male", "faceRectangle": { "width": 137, "height": 137, "left": 159, "top": 101 } } ]
  43. Tags [ { "name": "outdoor", "confidence": 0.9988287091255188 }, { "name": "tree", "confidence": 0.9911515116691589 }, { "name": "grass", "confidence": 0.9769880771636963 }, { "name": "person", "confidence": 0.9731658697128296 }, { "name": "shirt", "confidence": 0.8072543740272522 }, { "name": "smiling", "confidence": 0.7123119831085205 }, { "name": "posing", "confidence": 0.46504953503608704 } ]
  44. e dùng library image net của google
  45. để xác định vật thể có trong bức ảnh
  46.  
  47. thế thì nó có ý nghĩa gì
  48. api của google anh chưa dùng, của microsoft thì dùng rồi, nhưng chỉ là nhận diện khuôn mặt và đưa ra các chỉ số cảm xúc..., hoặc có bao nhiêu người trong ảnh
  49. tức là đã phải xác định đó là phân tích về những người có trong tấm hình
  50. scope nó rất rõ ràng nhiêu đó
  51. còn nó có api xác định trong hình có những đối tượng nào chưa?
  52. rồi chứ
  53. để e đưa a xem
  54. https://www.microsoft.com/cognitive-services/en-us/computer-vision-api
  55. a xem cái request nó trả về có phần tags
  56. còn về việc nếu không sử dụng api
  57. thì gg cũng có 1 mạng lưới image net, có hầu hết toàn bộ 1 kho image của tất cả để xác định
  58.  
  59. nó xác định có những đối tượng với info gì?
  60. hay chỉ là trong hình có water, glass
  61.  
  62. nó xác định đối tượng là gì và có mô tả description
  63.  
  64. ừ, nó có xác định đối tượng là gì với 1 confidence number
  65. trong 1 số đối tượng, nó sẽ xác định tính chất đó
  66. *tính chất của đối tượng đó
  67. yep, cái confidence number này có thể là do sự đa dạng của dữ liệu
  68.  
  69. về việc xác định đối tượng thì độ chính xác khá cao rồi (nó learn khá nhiều nên cái này ok), tính chất trả về ok luôn đi
  70. yep, chỉ có phần mô tả
  71.  
  72. giả sử confidence là 100% luôn
  73. vậy thì câu hỏi từ ban đầu, em biết cái gì là quan trọng ?
  74. và dựa vào đâu để biết
  75. e nghĩ đối với người khiếm thị thì việc chỉ cần biết được mình đang nhìn cái gì là quan trọng nhất, còn việc nó ra thế nào làm sao thì còn tuỳ vào mỗi người suy nghĩ nó như thế nào
  76. đương nhiên lần đầu làm thì e k thể làm được description info là 100% được
  77.  
  78. đó cái em nói "biết được đang nhìn gì"
  79. anh ko nói là em ko làm được
  80. vấn đề vẫn là cái scope nó là gì
  81. API nó chỉ cho em information
  82. nó cho càng chính xác thì vừa dễ mà cũng vừa khó
  83. gỉa sử tấm hình cô gái mặc bikini đó đi
  84. có thêm 1 con chó kế bên
  85. hoặc 1 đàn chó đi
  86. cả 2 đều có confidence cao
  87. thì em bảo có 2 đối tượng đó
  88. xong tăng thêm con mèo
  89. rồi tăng thêm con heo chẳng hạn ... và tăng lên cỡ 100 đối tượng có confidence cao hết
  90. em sẽ bảo với người mù đang nhìn gì
  91. ý chính của anh là ko phải em ko làm được
  92. nhưng cách anh nói có nghĩa là
  93. 1 ví dụ làm vấn đề có thể phức tạp lên
  94. nếu cứ tăng thêm và có confidence cao e nghĩ cũng bình thường mà ta
  95.  
  96. em phải chọn 1 vấn đề để giải quyết
  97. cho câu bảo bình thường trên
  98. khi tất cả đều quan trọng
  99. thì chẳng có gì quan trọng
  100. e nghĩ người khiếm thị thì họ đâu focus được 1 vật muốn nhìn, cái gì trước mắt họ thì nó báo thôi
  101.  
  102. đó
  103. em thấy cái bug hệ thống ở đây ko "cái gì trước mắt họ thì nó báo thôi"
  104. confidence tuyệt đối cho 100 vật trước mắt
  105. thế thì nó báo 100 thứ, người khiếm thị phải nghe 100 tên à
  106. ý a là độ focus ấy hử
  107.  
  108. 100 thôi là đủ chết, chưa nói có khi cả 1000, 10k
  109. còn việc em bảo có gì nó báo
  110. thì đúng rồi, em dùng API
  111. và API nó cho hết rồi
  112. cái chính là em phải nói từ cái API ấy, em làm cái gì thêm "hợp lý" và giải quyết vấn đề cụ thể cho người khiếm thị
  113. ví dụ
  114. e nghĩ chỉ cần giảm bán kính xuống là được thôi, ví dụ trong bán kính 2m từ người mù đi tới, có vật gì báo vật đó
  115.  
  116. em giảm xuống còn 20cm cũng vẫn còn vấn đề đó
  117. em cầm cái máy chụp hình lên chụp bán kính 2m xem thấy cái gì
  118. nên nhớ là nhìn trong 3D, ko phải 1D hay 2D
  119. em nhìn thẳng bán kính 2m thì nó ra không khí :))
  120. thôi anh chuẩn bị ngủ
  121. cho chú 1 ví dụ tạm gọi là scope phù hợp
  122. kính xác định VẬT CẢN
  123. đâu đâu
  124.  
  125. cho người khiếm thị
  126. tức là từ thông tin có được, chú tìm tính chất nào để xác định nó là vật cản thôi
  127. và vật cản thì chỉ những thứ thẳng trước mặt
  128. ở một độ cao nhất định
  129. à
  130. camera nó có chế độ focus
  131. just recognition when focus
  132.  
  133. **lưu ý: đây chỉ là ví dụ minh hoạ cho việc thu nhỏ scope lại, có indicator để xác định 1 vấn đề nhất định, có thể nó vẫn chưa đủ nhỏ
  134. còn cái em nói focus thì anh chưa nghĩ tới
  135. e mới cầm máy ảnh lên
  136. có xoá phông ấy
  137.  
  138. chỉ nói thêm là ví dụ đưa ra được output cụ thể
  139. :v
  140. okey
  141.  
  142. vấn đề và lợi ích
  143. còn cái focus của em có vẻ ko liên quan lắm :))
  144. nói chung là góp ý thế này, ngoài cái ý tưởng
  145. có chứ, a focus được thì cái focus nó rõ còn các vật xung quanh sẽ mờ lại, vật rõ thì mới được detection, detection được thì mới recognition
  146.  
  147. thì chú chịu khó tìm tòi, nhưng kiến thức nền chưa có, nên suy nghĩ vấn đề còn đơn giản, chưa thấy được độ phức tạp thực sự
  148. dạ 😛
  149.  
  150. nên chỉ có thể làm mấy thứ nhìn có vẻ cool (đúng là cool hơn mấy người ko làm gì) nhưng giải quyết vấn đề tới nơi tới chốn thì bất khả thi
  151. vâng 😛
  152.  
  153. học ở VN thì ko chât lượng, nhưng ko học thì bó tay đấy, ít nhất phải theo học course online nào đấy tới nơi tới chốn
  154. có nền tảng
  155. kết hợp với tìm tòi giải pháp bên ngoài thì mới ổn
  156. vậy nhé
  157. anh đi ngủ
  158. Trần Nguyễn Duy Tuấn
  159. Tuấn
  160. a đưa ra 1 vấn đề cho mình giải quyết
Advertisement
Add Comment
Please, Sign In to add comment